Pulse · AI 뉴스

RTX 3090에서 Qwen3.8-Flash 실행: 12GB VRAM으로도 가능

Qwen · 2026-08-29

사용자가 RTX 3090에서 Qwen3.8-Flash-next를 실행하는 방법을 공유했어요. 64GB RAM 환경에서 IQ4_XS 가중치, 전체 kvarn5 컨텍스트, GPU 비전 등을 활용했어요.

160 tok/s 프리필, 16 tok/s 디코드를 기록하며, 장시간 사용에 적합하지만 실시간 작업에는 부적합해요.

VRAM 용량에 따라 KV 양자화 수준을 조정하여 12GB 카드에서도 실행 가능하며, 16GB VRAM으로도 활용할 수 있지만 주의가 필요해요.

GitHub 저장소를 통해 원클릭 배포, llamacpp 포크, llamacpp 프리셋을 제공하며, Vulkan 및 ROCm 환경에서도 작동할 수 있어요.

##Qwen##RTX3090##LLM##VRAM##최적화
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기