Pulse · AI 뉴스

공개 WAN 환경에서 Qwen2.5-7B 모델, 스펙티브 디코딩 및 CUDA 그래프 활용 시 28 TPS 달성

Qwen · 2026-08-23

Rautaditya Katua가 ShardFlow라는 분산 LLM 추론 프레임워크를 개발했어요. 이 프레임워크는 HuggingFace 트랜스포머를 N개의 GPU 머신으로 분산하고, WAN 지연 문제를 해결하기 위해 뉴럴 스펙티브 디코딩을 사용해요.

Iowa와 Oregon의 T4 노드 간 TCP Relay를 통해 Qwen2.5-7B 모델을 테스트한 결과, 스펙티브 디코딩과 CUDA 그래프를 활용해 평균 20.31 TPS, 최대 28.10 TPS를 기록했어요.

스펙티브 디코딩은 WAN 지연을 토큰당 비용이 아닌 라운드당 비용으로 전환하는 핵심 인사이트를 제공하며, CUDA 그래프를 활용해 드래프트 지연 시간을 112ms에서 25ms로 줄이는 효과를 거뒀어요.

ShardFlow 프로젝트 GitHub 저장소는 https://github.com/rautaditya2606/Shardflow에서 확인할 수 있으며, 스펙티브 디코딩 구현 및 CUDA 그래프 관련 질문에 답변할 예정이에요.

##LLM##분산추론##스펙티브디코딩##CUDA##Qwen
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기