InclusionAI의 Ling 모델이 단일 응답으로 15,128 토큰을 생성하는 데 성공했어요. GPU 모니터링 대시보드 프론트엔드 생성을 요청하는 프롬프트를 사용했어요. 생성 속도는 35.68 토큰/초를 기록했으며, 7분 동안 실행됐어요.
Ling-3.0-flash 모델은 커뮤니티 Q5 GGUF로 구동되며, 단일 DGX Spark에서 실행됐어요. 생성된 대시보드는 실제 GPU 정보를 읽지 못하고 더미 데이터를 사용했어요.
이 실험은 LLM의 성능과 응답 생성 과정을 보여주는 중요한 사례로, 특히 KV 캐시와 디코딩 속도에 주목할 만해요.