사용자가 RTX 3090에서 Qwen3.8-Flash-next를 실행하는 방법을 공유했어요. 64GB RAM 환경에서 IQ4_XS 가중치, 전체 kvarn5 컨텍스트, GPU 비전 등을 활용했어요.
160 tok/s 프리필, 16 tok/s 디코드를 기록하며, 장시간 사용에 적합하지만 실시간 작업에는 부적합해요.
VRAM 용량에 따라 KV 양자화 수준을 조정하여 12GB 카드에서도 실행 가능하며, 16GB VRAM으로도 활용할 수 있지만 주의가 필요해요.
GitHub 저장소를 통해 원클릭 배포, llamacpp 포크, llamacpp 프리셋을 제공하며, Vulkan 및 ROCm 환경에서도 작동할 수 있어요.