Langsung ke isi
· Kabar AI, jernih dan terverifikasiNewsletter  ·  Majalah
Langganan
Terkini
Trending

Hugging Face Luncurkan Open TTS Leaderboard untuk Uji AI Suara

Hugging Face menghadirkan sistem evaluasi objektif untuk model pengubah teks menjadi suara terbuka, memangkas waktu uji dari hitungan minggu menjadi beberapa jam.

Hugging Face Rilis Open TTS Leaderboard untuk Evaluasi Ribuan Model Suara Terbuka

Foto: Hugging Face Blog (Materi resmi)

Poin penting

  • Open TTS Leaderboard hadir di tengah peredaran lebih dari 8.000 model text-to-speech di Hugging Face.
  • Evaluasi berbasis metrik objektif memangkas waktu pemeringkatan dari berminggu-minggu menjadi beberapa jam.
  • Model Kokoro-82M, OmniVoice, dan Pocket-TTS memimpin pada kategori akurasi dan latensi streaming.

Memilih model AI pengubah teks jadi suara kini jauh lebih mudah. Langkah ini penting bagi pengembang asisten suara dan kreator konten digital. Menurut Hugging Face Blog, repositori tersebut merilis Open TTS Leaderboard.

Papan peringkat ini menguji model suara sumber terbuka secara objektif.

Jumlah model pengubah teks menjadi suara berkembang sangat pesat. Ada lebih dari 8.000 model suara di Hugging Face Hub. Namun, sistem pengujian model selama ini dinilai lambat dan terpecah-pecah.

Standar lama banyak mengandalkan penilaian manusia lewat papan peringkat arena.

Mengatasi Keterbatasan Papan Peringkat Lama

Papan peringkat arena seperti Artificial Analysis dan Voice Arena memakai sistem voting. Pengguna mendengarkan dua audio lalu memilih hasil yang paling bagus. Proses pengumpulan suara ini membutuhkan waktu berminggu-minggu.

Pilihan manusia juga sering berubah dan sulit konsisten seiring waktu.

Model sumber terbuka kerap terpinggirkan di arena voting tersebut. Hanya 16 dari 92 model di Artificial Analysis berstatus bobot terbuka. Penyedia API komersial lebih mudah masuk karena hanya butuh kunci akses.

Sebaliknya, pengelola arena harus memasang dan menjalankan sendiri model terbuka.

Open TTS Leaderboard memangkas waktu evaluasi menjadi beberapa jam saja. Tingkat kejelasan kata dinilai lewat rasio kesalahan kata menggunakan Qwen3 ASR. Kemiripan kloning suara diukur memakai perbandingan vektor penyematan WavLM.

Kecepatan dihitung lewat faktor waktu nyata pada cip grafis H200.

Deretan Model Unggulan dan Fitur Streaming

Pada pengujian bahasa Inggris, tiga model mencatat kesalahan kata paling rendah. Model tersebut adalah Kokoro-82M, supertonic-3, dan s2-pro. Pengujian aksara Mandarin, Jepang, dan Korea memakai rasio kesalahan karakter.

Model OmniVoice, s2-pro, dan Fun-CosyVoice3 menunjukkan performa multibahasa yang tangguh.

Kloning suara terbukti meningkatkan akurasi beberapa model tertentu. Model higgs-tts-3-4b dan VoxCPM2 makin akurat saat diberi audio rujukan. Pengguna juga dapat membuka tab Listen untuk mendengar hasil rekaman.

Fitur ini memungkinkan pengguna memberi masukan langsung memakai akun Hugging Face.

Tab Streaming mengukur latensi waktu hingga audio pertama terdengar atau TTFA. Ukuran ini sangat krusial untuk pembuatan agen percakapan interaktif. Pengujian memakai 50 teks bahasa Inggris dengan setelan suara bawaan.

Model pocket-tts terbukti bekerja sangat cepat pada GPU maupun CPU.

Peluang bagi Pengembang dan Pelaku Bisnis

Kehadiran papan peringkat ini mempermudah bisnis memilih teknologi suara yang tepat. Pelaku usaha tidak perlu bingung memilih di antara banyaknya model yang beredar. Mereka bisa langsung menyaring model berdasarkan latensi, ukuran, atau bahasa.

Hugging Face juga segera membagikan skrip evaluasi ini secara terbuka di GitHub.

✓ Diperiksa AI dan disetujui redaksi. Artikel ini ditulis AI, 10 klaimnya dicocokkan dengan sumber, dan diuji keterbacaannya sebelum terbit. Menemukan kekeliruan? Laporkan ke redaksi.
Lihat hasil pemeriksaan
Pembuka: 8/10Kejelasan: 8/10Struktur: 8/10Manfaat: 8/10Bahasa: 8/10
KlaimPutusanDasar di sumber
Hugging Face merilis Open TTS Leaderboard untuk menguji model text-to-speech sumber terbuka.Didukung“To this end, we've built the Open TTS Leaderboard, which uses objective metrics to evaluate models on complementary aspects of performance”
Dinyatakan dalam blog Hugging Face mengenai peluncuran Open TTS Leaderboard.
Terdapat lebih dari 8.000 model text-to-speech di Hugging Face Hub.Didukung“On the Hugging Face Hub (as of Sep 30, 2026) there are more than 8K TTS models available”
Dinyatakan dalam blog Hugging Face.
Evaluasi berbasis metrik objektif memangkas durasi evaluasi dari berminggu-minggu menjadi beberapa jam.Didukung“By relying on objective metrics evaluating a model drops from a couple weeks (for collecting votes) to a couple hours”
Dinyatakan dalam blog Hugging Face.
Hanya 16 dari 92 model di Artificial Analysis yang berstatus bobot terbuka (open-weights).Didukung“as of Sep 30, 2026, only 16 of the 92 models on Artificial Analysis are open-weights, with a similar skew on Voice Arena.”
Dinyatakan dalam blog Hugging Face.
Tingkat kejelasan dinilai menggunakan Qwen3 ASR dan kemiripan suara dinilai menggunakan WavLM.Didukung“WER and CER) between the prompt and the generated audio's transcript, using Qwen3 ASR (top ranking open-source model on the Open ASR Leaderboard).”
Dinyatakan dalam bagian metrik evaluasi Open TTS Leaderboard.
Kokoro-82M, supertonic-3, dan s2-pro memimpin perolehan WER terendah untuk bahasa Inggris.Didukung“hexgrad/Kokoro-82M, Supertone/supertonic-3, and fishaudio/s2-pro lead the pack on English WER when averaged on these two splits”
Dinyatakan dalam bagian evaluasi bahasa Inggris.
OmniVoice, s2-pro, dan Fun-CosyVoice3-0.5B-2512 merupakan model multibahasa yang kuat.Didukung“k2-fsa/OmniVoice, fishaudio/s2-pro, and FunAudioLLM/Fun-CosyVoice3-0.5B-2512 are strong multilingual models.”
Dinyatakan dalam bagian evaluasi multibahasa.
Model higgs-tts-3-4b dan VoxCPM2 mencatat peningkatan performa saat fitur kloning suara (audio rujukan) digunakan.Didukung“average WER of some models, such as bosonai/higgs-tts-3-4b and openbmb/VoxCPM2, improve under voice cloning, namely when a reference audio is provided.”
Dinyatakan dalam bagian voice cloning.
Tab Streaming menguji TTFA memakai 50 prompt bahasa Inggris dari CV3-Eval dan model pocket-tts terbukti unggul di GPU serta CPU.Didukung“kyutai/pocket-tts is a great model for streaming on both GPU and CPU!”
Dinyatakan dalam bagian evaluasi streaming performance.
Hugging Face akan segera membuka skrip evaluasi ini di GitHub.Didukung“We will soon open-source the evaluation scripts, much like the Open ASR Leaderboard repo, so that you can directly provide your feedback and suggestions via GitHub Issues and PRs!”
Dinyatakan pada bagian penutup blog Hugging Face.

Tanya jawab

Apa itu Open TTS Leaderboard?

Open TTS Leaderboard adalah papan peringkat dari Hugging Face untuk menguji model AI pengubah teks menjadi suara sumber terbuka secara objektif.

Apa saja model dengan tingkat kesalahan terendah dalam bahasa Inggris?

Tiga model yang mencatat kesalahan kata paling rendah pada pengujian bahasa Inggris adalah Kokoro-82M, supertonic-3, dan s2-pro.

Bagaimana cara Open TTS Leaderboard menguji model suara?

Sistem ini menguji kejelasan kata memakai Qwen3 ASR, kemiripan kloning dengan WavLM, dan kecepatan waktu nyata pada cip grafis H200.

Sumber: Hugging Face Blog: Open TTS Leaderboard: Scalable Evaluation for Multilingual Text-to-Speech and Voice Cloning

Baca juga