llama.cpp가 Ling-3.0 (BailingMoE3) 모델을 정식으로 지원하게 됐어요. bartowski 사용자가 Ling-3.0-tiny (8B)와 Ling-3.0-flash (127B) 모델의 GGUF 양자화 버전을 공개했어요.
Intel Arc B580 환경에서 Ling-3.0-tiny 모델을 테스트한 결과, 128K 컨텍스트 환경에서 120.76 t/s의 속도를 보여줬어요.
12GB VRAM으로 128K 컨텍스트를 실행할 수 있으며, 경고 메시지가 표시되긴 하지만 더 높은 성능도 기대할 수 있어요.