Pulse · AI 뉴스

[Deepseek-V4-Flash-0731] 단일 RTX 5090에서 1M 컨텍스트 전체 구현 + VLLM CPU/Ram 오프로딩, ~800 tps pp 및 15+ tps 디코딩

DeepSeek-V4-Flash-0731 · 2026-08-04

BlackBeardAI 사용자가 RTX 5090 GPU와 Ryzen 9 9950X3D CPU를 사용하여 DeepSeek-V4-Flash-0731 모델을 1M 컨텍스트로 실행하는 데 성공했어요. CUDA IPC helper 문제를 해결하기 위해 수동 패치를 적용했죠.

vLLM 2.3.9와 lk_moe 2.3.2를 사용하여 GPU 메모리 활용률 92%로 설정하고, 48개의 safetensors shards를 활용하여 ~155.4 GiB 체크포인트 크기를 관리했어요.

DSpark (Dynamic Speculative Decoding) 사용 시 reasoning 구간에서 draft acceptance율이 낮아지면서 성능 저하가 발생하는 것을 확인하고, reasoning/thinking 시에는 1개, 일반/최종 디코딩 시에는 2개의 speculative token을 사용하는 방식으로 최적화할 계획이에요.

##DeepSeek##vLLM##RTX5090##DSpark##1MContext
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기