사용자가 qwen3.8:27B 모델로 39KB C 코드를 HTML/three.js로 변환하는 실험을 진행했어요. Claude Opus 5는 21분 만에 완료했지만, qwen3.8:27B는 4시간 18분이나 걸렸어요. Hermes 모델은 1시간 40분 동안 잘못된 코드를 생성했고, Claude Opus 5는 '괜찮은' 품질의 결과물을 냈어요.
실험 결과, 로컬 모델의 성능은 프롬프트에 크게 의존하며, 복잡한 환경도 부족한 프롬프트를 보완할 수 없다고 해요. 프롬프트가 부족하면 GPU 시간이 낭비될 수 있어요.
C 원본 코드는 GitHub에서 확인할 수 있으며, 실험에 사용된 로컬 LLM 환경도 공개됐어요. 이 실험은 로컬 LLM의 한계와 클라우드 기반 모델의 효율성을 보여주는 사례입니다.