Tontaube 팀이 29억 파라미터 오픈 TTS 모델 TontaubeV1을 공개했어요. 영어와 독일어 지원하며, 1분 분량의 오디오만으로 음성 복제 가능.
모델은 4개의 autoregressive 모델로 구성되어 있으며, RTX 5090에서 단일 텍스트 기준 0.08 RTF, 배치 처리 시 0.02 RTF로 낮은 지연 시간 제공.
LLM-as-a-judge 평가에서 ElevenLabs Flash v2.5보다 높은 점수를 획득했으며, 향후 TTS Arena V2, Artificial Analysis Text to Speech Arena에서 사용자 평가 진행 예정.