audio.cpp 0.6 버전이 출시되어 dots.tts, NeuTTS-2e, MiniMax-H3 등 5개의 새로운 모델 패밀리가 추가됐어요. 이번 업데이트에는 네이티브 WebUI 기능이 추가되었고, MiniMax-H3는 텍스트 음성 변환, 음성 복제, 음악 생성 기능을 제공해요.
MiniMax-H3는 DiT 모델의 구성 요소를 풍부하게 하여 SageAttention, First Block Cache, Spectrum을 수동으로 설정할 필요 없이 모델 실험을 용이하게 해요. 또한, MiniMax-Music3는 현재 프리뷰 버전으로, CUDA/Vulkan/HIP 환경에서 테스트되었으며, 최적화될 예정이에요.
VibeVoice 1.5B의 소스 코드가 공개되었으며, 다음 릴리스의 모델에 대한 조기 액세스를 원한다면 dev 브랜치를 주시해 주세요. 네이티브 UI, MiniMax-Music3 등 모든 측면에 대한 피드백과 PR은 언제나 환영해요.