BlackBeardAI 사용자가 RTX 5090 GPU와 Ryzen 9 9950X3D CPU를 사용하여 DeepSeek-V4-Flash-0731 모델을 1M 컨텍스트로 실행하는 데 성공했어요. CUDA IPC helper 문제를 해결하기 위해 수동 패치를 적용했죠.
vLLM 2.3.9와 lk_moe 2.3.2를 사용하여 GPU 메모리 활용률 92%로 설정하고, 48개의 safetensors shards를 활용하여 ~155.4 GiB 체크포인트 크기를 관리했어요.
DSpark (Dynamic Speculative Decoding) 사용 시 reasoning 구간에서 draft acceptance율이 낮아지면서 성능 저하가 발생하는 것을 확인하고, reasoning/thinking 시에는 1개, 일반/최종 디코딩 시에는 2개의 speculative token을 사용하는 방식으로 최적화할 계획이에요.