사용자가 Qwen 3.8 flash next 모델을 6GB VRAM 환경에서 테스트해봤어요. Ubuntu 환경에서 llama.cpp를 통해 6~7 TPS를 기록했어요. 1비트 양자화 모델로도 뛰어난 성능을 보여줘서 더 높은 양자화 모델을 시도해볼 예정이에요.
사용자는 더 나은 성능을 위해 어떤 양자화 모델을 시도해볼지 문의했어요. 모델 다운로드/삭제 반복을 줄이기 위해 의견을 구하고 있어요. Reddit 게시글에 테스트 결과와 스크린샷을 공유했어요.
Qwen 3.8 flash next 모델은 6GB GPU와 16GB 시스템 RAM 환경에서 쾌적하게 사용할 수 있다는 점이 주목할 만해요.