Pulse · AI 뉴스

Qwen3.8 27B 모델, 구형 INT8 하드웨어에서 972 토큰/초 속도로 구동하는 vLLM 포크 공개

Qwen · 2026-08-27

사용자 curvedinf가 Qwen3.8 27B 모델을 구형 INT8 하드웨어에서 더 빠르게 구동하기 위한 vLLM 포크를 공개했어요. 이 포크는 INT8 지원을 강화하여 기존 하드웨어의 성능을 최적화했어요. 4x MI100 시스템에서 972 토큰/초의 속도를 달성하며, 이는 기존 vLLM보다 훨씬 빠른 속도예요.

새로운 스택은 완전한 INT8 텐서 병렬 지원, KV 캐시, AITER 통합 어텐션 등 다양한 기능을 포함하고 있어요. 또한 XGMI 인터링크에 최적화된 커스텀 allreduce/allgather 기능도 추가되었어요. 이러한 개선을 통해 구형 하드웨어에서도 더 나은 성능을 얻을 수 있어요.

이 프로젝트는 Qwen3.8 모델에 맞춰 세심하게 조정되었지만, 다른 모델 아키텍처에도 적용 가능하며, 특히 AMD MI50, MI210 등 구형 AMD 카드에서 효과적일 것으로 예상돼요. 사용자는 GitHub 저장소에서 코드와 정확도 검증 스크립트를 확인할 수 있으며, 피드백과 PR을 환영해요.

##vLLM##Qwen3.8##INT8##최적화
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기