Pengenalan Voxtral TTS
Voxtral TTS adalah model text-to-speech yang dikembangkan oleh Mistral, sebuah startup AI asal Perancis. Model ini dapat mengkloning suara dari 3 detik audio dalam 9 bahasa, termasuk Jerman, Inggris, Perancis, dan Spanyol.
Detail Teknis
Voxtral TTS memiliki 4 miliar parameter dan dapat menghasilkan suara yang realistis dan ekspresif. Model ini juga dapat beradaptasi dengan suara baru dari audio referensi yang sangat singkat. Dengan latency hanya 70 milidetik, Voxtral TTS dapat digunakan dalam berbagai aplikasi.
Fitur Utama
- Mengkloning suara dari 3 detik audio: Voxtral TTS dapat mengkloning suara dari audio referensi yang sangat singkat.
- 9 bahasa yang didukung: Model ini dapat mengkloning suara dalam 9 bahasa, termasuk Jerman, Inggris, Perancis, dan Spanyol.
- Latency rendah: Dengan latency hanya 70 milidetik, Voxtral TTS dapat digunakan dalam berbagai aplikasi.
Pendapat Geek
Voxtral TTS adalah contoh dari kemajuan teknologi AI dalam pengembangan model text-to-speech. Dengan kemampuan mengkloning suara dari audio referensi yang sangat singkat, Voxtral TTS dapat digunakan dalam berbagai aplikasi, seperti asisten virtual dan sistem otomasi.



