Papan peringkat speech-to-text bahasa Mongol
Bandingkan tingkat kesalahan kata, kecepatan, dan harga antar penyedia speech-to-text untuk bahasa Mongol. Setiap angka diukur pada audio Mongol nyata — bukan pemasaran.
Dataset yang dipakai
Korpus ucapan publik yang dipakai pada tiap pengujian penyedia. Buka URL sumber untuk melihat kartu dataset, lisensi, dan unduhannya.
- Common Voice 24 (MN)›https://huggingface.co/datasets/btsee/common-voices-24-mn
- Shunya Labs Mongolian Speech›https://huggingface.co/datasets/shunyalabs/mongolian-speech-dataset
- Common Voice 20 (MN)›https://huggingface.co/datasets/warmestman/common-voice-20-mn-normalized
- Modern Voice›Direkam sendiri untuk benchmark ini — audio tidak dibagikan, hanya metriknya.
WER vs kecepatan
Setiap titik adalah satu penyedia. Titik ideal di kanan bawah (sedikit kesalahan, cepat). Diukur pada audio Mongol nyata.
Perbandingan penyedia
Urutkan kolom apa pun. Klik Detail untuk rincian per sampel, harga, dan metodologi sebuah penyedia.
| Penyedia | WER ↑ | CER | Akurasi | Kecepatan | Latensi | Harga / 1000 menit | |
|---|---|---|---|---|---|---|---|
Speechmatics | 14.4% | 7.4% | 85.6% | 0.51× | 13.8s | $8.5 | Detail |
Duudlaga FlowMilik kami | 14.6% | 7.6% | 85.4% | 1.47× | 5.2s | $19.4 | Detail |
Chimege | 14.6% | 6.6% | 85.4% | 1.51× | 4.7s | $11.1 | Detail |
Google STT | 16.9% | 7.4% | 83.1% | 1.98× | 3.7s | $16 | Detail |
Whisper large-v2 MN | 20.7% | 8.3% | 79.3% | 0.53× | 13.5s | $0 | Detail |
Azure Speech | 20.8% | 9.7% | 79.2% | 0.39× | 17.3s | $16.7 | Detail |
Whisper medium MNTumpang tindih | 22.5% | 8.9% | 77.5% | 2.7× | 2.7s | $0 | Detail |
SeamlessM4T v2 | 24% | 11.1% | 76% | 0.39× | 26.3s | $0 | Detail |
Whisper turbo MNTumpang tindih | 25.7% | 9.2% | 74.3% | 2.43× | 3.0s | $0 | Detail |
ElevenLabs Scribe v1 | 27.1% | 10.8% | 72.9% | 2.14× | 3.3s | $6.7 | Detail |
ElevenLabs Scribe v2 | 27.1% | 10.6% | 72.9% | 1.51× | 4.7s | $3.7 | Detail |
Gemma 4 | 30.2% | 14.7% | 69.8% | 1× | 7.3s | $0 | Detail |
OmniASR LLM-1B | 33.8% | 14.2% | 66.2% | 0.27× | 26.6s | $0 | Detail |
Whisper large-v3 MNTumpang tindih | 39.4% | 14.9% | 60.6% | 1.57× | 4.5s | $0 | Detail |
MMS-1B-all | 41.7% | 12.3% | 58.3% | 19.2× | 0.4s | $0 | Detail |
wav2vec2 XLSR-53 MNTumpang tindih | 45% | 16.4% | 55% | 42.32× | 0.2s | $0 | Detail |
Dolphin small | 49.1% | 19.2% | 50.9% | 1.73× | 4.1s | $0 | Detail |
OmniASR CTC-1B | 51.2% | 15.5% | 48.8% | 0.6× | 11.7s | $0 | Detail |
GPT-4o Transcribe | 53% | 27.6% | 47% | 2.11× | 3.7s | $6 | Detail |
Moonshine MNTumpang tindih | 58.8% | 45.2% | 41.2% | 8.44× | 0.8s | $0 | Detail |
Whisper large-v3 | 89.5% | 37.4% | 10.5% | 1.29× | 6.0s | $0 | Detail |
Gladia | 90.1% | 38.9% | 9.9% | 0.75× | 9.4s | $10.2 | Detail |
Whisper large-v3-turbo | 99% | 54.4% | 1% | 0.91× | 8.7s | $0 | Detail |
Qwen3-ASR-Flash | 103.7% | 86.4% | -3.7% | 2.19× | 3.2s | $2.1 | Detail |
OpenAI Whisper | 105.2% | 63.7% | -5.2% | 1.5× | 4.5s | $6 | Detail |
VibeVoice ASR | 107% | 61% | -7% | 0.53× | 12.1s | $0 | Detail |
Gemini Flash | Benchmark segera hadir | ||||||
Semua hasil diukur pada dataset Mongol nyata. Kecepatan adalah × waktu nyata (lebih tinggi = lebih cepat). WER lebih rendah lebih baik.
Tumpang tindih— Model dengan lencana ini dilatih pada data yang tumpang tindih dengan korpus benchmark (Common Voice Mongolia — 113 dari 173 sampel — atau korpus publik Shunya Labs). Skor pada korpus yang tumpang tindih menjadi tinggi karena hafalan; nilai model ini lewat tabel per dataset di halaman detailnya, terutama korpus yang TIDAK dipakai melatihnya.
Duudlaga Voice Set
92 samples · 10.2 min · 28 systemsA second corpus recorded first-party for this benchmark, covering what the public Mongolian datasets barely contain: modern loanwords, English/Mongolian code-switching, numbers, dates, and commands. Every system is measured on the same 92 recordings.
| Penyedia | WER | CER | Akurasi | Kecepatan |
|---|---|---|---|---|
1Duudlaga FlowMilik kami | 9.5% | 5.3% | 90.5% | 1.27× |
2Google STT | 11.7% | 5.5% | 88.3% | 2.28× |
3Chimege | 14.5% | 6.8% | 85.5% | 1.48× |
4Speechmatics | 15.3% | 7.6% | 84.7% | 0.5× |
5Gemini 3.5 Flash | 19.5% | 11.4% | 80.5% | 0.06× |
6SeamlessM4T v2Sumber terbuka | 22.9% | 10.4% | 77.1% | 4.32× |
7Whisper large-v2 MNSumber terbuka | 23.2% | 10.9% | 76.8% | 0.55× |
8ElevenLabs Scribe v1 | 23.4% | 9.3% | 76.6% | 2.09× |
9ElevenLabs Scribe v2 | 24.6% | 9.8% | 75.4% | 1.47× |
10Azure Speech | 26.1% | 10.9% | 73.9% | 0.32× |
11Gemma 4Sumber terbuka | 27.7% | 13.2% | 72.3% | 1.04× |
12OmniASR LLM-1BSumber terbuka | 34.5% | 14.5% | 65.5% | 0.27× |
13Whisper medium MNSumber terbukaTumpang tindih | 35.1% | 14.8% | 64.9% | 2.71× |
14Whisper turbo MNSumber terbukaTumpang tindih | 37.6% | 14.1% | 62.4% | 2.59× |
15Whisper large-v3 MNSumber terbukaTumpang tindih | 41% | 17.1% | 59% | 1.58× |
16GPT-4o Transcribe | 44.3% | 23.7% | 55.7% | 2.62× |
17MMS-1B-allSumber terbuka | 45.3% | 15.1% | 54.7% | 20.52× |
18Dolphin smallSumber terbuka | 46.1% | 19% | 53.9% | 1.69× |
19W2v-BERT 2.0 MNSumber terbukaTumpang tindih | 46.3% | 18.2% | 53.7% | 28.12× |
20OmniASR CTC-1BSumber terbuka | 54.9% | 18.9% | 45.1% | 0.59× |
21wav2vec2 XLSR-53 MNSumber terbukaTumpang tindih | 56.3% | 23.9% | 43.7% | 45.7× |
22Whisper large-v3Sumber terbuka | 87.3% | 36.6% | 12.7% | 1.55× |
23Gladia | 88.1% | 39.9% | 11.9% | 0.74× |
24Moonshine MNSumber terbukaTumpang tindih | 96.2% | 75.7% | 3.8% | 8.36× |
25Whisper large-v3-turboSumber terbuka | 98.1% | 57.1% | 1.9% | 1.19× |
26Qwen3-ASR-Flash | 103.6% | 89.9% | -3.6% | 2.07× |
27OpenAI Whisper | 104.6% | 63.8% | -4.6% | 1.32× |
28VibeVoice ASRSumber terbuka | 110.1% | 64% | -10.1% | 0.4× |
Direkam sendiri untuk benchmark ini — audio tidak dibagikan, hanya metriknya.