사용자가 Strix Halo 보드와 R9700 Pro AI 카드를 결합하여 Qwen-3.5-122B 모델의 추론 속도를 2배로 향상시켰습니다. 이 조합은 49 tok/s, 682 tok/s prefill 속도를 보여줍니다.
모델의 일부를 Strix Halo의 통합 메모리에, 밀집된 부분을 R9700에 배치하여 성능을 최적화했습니다. KV 캐시, 밀집 모델 부분, MTP drafter를 R9700에 배치하고, 나머지 레이어를 R9700 VRAM에 적재했습니다.
사용자는 llama 서버 설정을 조정하여 커널 실행 횟수를 줄이고 성능을 개선했습니다. GitHub 저장소에서 관련 설정 및 모델을 확인할 수 있으며, 향후 이종 시스템 구성이 보편화될 가능성을 제시했습니다.
Alex Ziskind의 유사한 시도는 Vulkan 사용으로 인해 성능이 제한적이며, Qwen 3.8 flash-next 모델을 활용하는 방안도 고려 중입니다.
이 구성은 1년 이상 가능했지만, 플러그 앤 플레이 설정이 아니었으며, 현재는 약 500만 원 수준의 비용이 소요됩니다.