Muse Glimmer 30B 모델을 vLLM에서 DFlash 추론 방식으로 실행하는 데 6가지 수정이 필요했어요.
현재 vLLM 이미지에서 모델 이름 오류, vocab size 문제, 텐서 이름 불일치, 모델 wrapper 구조 오류, max_num_seqs 설정 오류 등이 발생했어요.
수정 후 RTX PRO 6000 Blackwell에서 DFlash 추론 속도가 약 2.3배 향상되었고, 평균 검증 단계당 약 2.5개의 토큰을 사용하며 전체 초안 수용률은 약 10%를 기록했어요.