Mongoolse spraak-naar-tekst leaderboard
Vergelijk woordfoutpercentage, snelheid en prijs van spraak-naar-tekst providers voor Mongools. Elk getal is gemeten op echte Mongoolse audio — geen marketing.
Gebruikte datasets
Openbare spraakcorpora die voor elke aanbiederrun zijn gebruikt. Open een bron-URL voor de datasetkaart, licentie en download.
- Common Voice 24 (MN)›https://huggingface.co/datasets/btsee/common-voices-24-mn
- Shunya Labs Mongolian Speech›https://huggingface.co/datasets/shunyalabs/mongolian-speech-dataset
- Common Voice 20 (MN)›https://huggingface.co/datasets/warmestman/common-voice-20-mn-normalized
- Modern Voice›Zelf opgenomen voor deze benchmark — audio wordt niet verspreid, alleen meetwaarden.
WER vs. snelheid
Elke stip is een provider. Ideaal is rechtsonder (weinig fouten, snel). Gemeten op echte Mongoolse audio.
Providervergelijking
Sorteer elke kolom. Klik op Details voor de per-sample uitsplitsing, prijzen en methodiek van een provider.
| Aanbieder | WER ↑ | CER | Nauwkeurigheid | Snelheid | Latentie | Prijs / 1000 min | |
|---|---|---|---|---|---|---|---|
Speechmatics | 14.4% | 7.4% | 85.6% | 0.51× | 13.8s | $8.5 | Details |
Duudlaga FlowEigen | 14.6% | 7.6% | 85.4% | 1.47× | 5.2s | $19.4 | Details |
Chimege | 14.6% | 6.6% | 85.4% | 1.51× | 4.7s | $11.1 | Details |
Google STT | 16.9% | 7.4% | 83.1% | 1.98× | 3.7s | $16 | Details |
Whisper large-v2 MN | 20.7% | 8.3% | 79.3% | 0.53× | 13.5s | $0 | Details |
Azure Speech | 20.8% | 9.7% | 79.2% | 0.39× | 17.3s | $16.7 | Details |
Whisper medium MNOverlap | 22.5% | 8.9% | 77.5% | 2.7× | 2.7s | $0 | Details |
SeamlessM4T v2 | 24% | 11.1% | 76% | 0.39× | 26.3s | $0 | Details |
Whisper turbo MNOverlap | 25.7% | 9.2% | 74.3% | 2.43× | 3.0s | $0 | Details |
ElevenLabs Scribe v1 | 27.1% | 10.8% | 72.9% | 2.14× | 3.3s | $6.7 | Details |
ElevenLabs Scribe v2 | 27.1% | 10.6% | 72.9% | 1.51× | 4.7s | $3.7 | Details |
Gemma 4 | 30.2% | 14.7% | 69.8% | 1× | 7.3s | $0 | Details |
OmniASR LLM-1B | 33.8% | 14.2% | 66.2% | 0.27× | 26.6s | $0 | Details |
Whisper large-v3 MNOverlap | 39.4% | 14.9% | 60.6% | 1.57× | 4.5s | $0 | Details |
MMS-1B-all | 41.7% | 12.3% | 58.3% | 19.2× | 0.4s | $0 | Details |
wav2vec2 XLSR-53 MNOverlap | 45% | 16.4% | 55% | 42.32× | 0.2s | $0 | Details |
Dolphin small | 49.1% | 19.2% | 50.9% | 1.73× | 4.1s | $0 | Details |
OmniASR CTC-1B | 51.2% | 15.5% | 48.8% | 0.6× | 11.7s | $0 | Details |
GPT-4o Transcribe | 53% | 27.6% | 47% | 2.11× | 3.7s | $6 | Details |
Moonshine MNOverlap | 58.8% | 45.2% | 41.2% | 8.44× | 0.8s | $0 | Details |
Whisper large-v3 | 89.5% | 37.4% | 10.5% | 1.29× | 6.0s | $0 | Details |
Gladia | 90.1% | 38.9% | 9.9% | 0.75× | 9.4s | $10.2 | Details |
Whisper large-v3-turbo | 99% | 54.4% | 1% | 0.91× | 8.7s | $0 | Details |
Qwen3-ASR-Flash | 103.7% | 86.4% | -3.7% | 2.19× | 3.2s | $2.1 | Details |
OpenAI Whisper | 105.2% | 63.7% | -5.2% | 1.5× | 4.5s | $6 | Details |
VibeVoice ASR | 107% | 61% | -7% | 0.53× | 12.1s | $0 | Details |
Gemini Flash | Benchmark binnenkort beschikbaar | ||||||
Alle resultaten zijn gemeten op echte Mongoolse datasets. Snelheid is × realtime (hoger = sneller). Lagere WER is beter.
Overlap— Modellen met dit label zijn getraind op data die overlapt met de benchmarkcorpora (Mongools Common Voice — 113 van de 173 monsters — of het openbare corpus van Shunya Labs). Scores op overlappende corpora zijn opgeblazen door memorisatie; beoordeel deze modellen op de tabel per dataset op hun detailpagina, vooral op de corpora waarop ze NIET zijn getraind.
Duudlaga Voice Set
92 samples · 10.2 min · 28 systemsA second corpus recorded first-party for this benchmark, covering what the public Mongolian datasets barely contain: modern loanwords, English/Mongolian code-switching, numbers, dates, and commands. Every system is measured on the same 92 recordings.
| Aanbieder | WER | CER | Nauwkeurigheid | Snelheid |
|---|---|---|---|---|
1Duudlaga FlowEigen | 9.5% | 5.3% | 90.5% | 1.27× |
2Google STT | 11.7% | 5.5% | 88.3% | 2.28× |
3Chimege | 14.5% | 6.8% | 85.5% | 1.48× |
4Speechmatics | 15.3% | 7.6% | 84.7% | 0.5× |
5Gemini 3.5 Flash | 19.5% | 11.4% | 80.5% | 0.06× |
6SeamlessM4T v2Open source | 22.9% | 10.4% | 77.1% | 4.32× |
7Whisper large-v2 MNOpen source | 23.2% | 10.9% | 76.8% | 0.55× |
8ElevenLabs Scribe v1 | 23.4% | 9.3% | 76.6% | 2.09× |
9ElevenLabs Scribe v2 | 24.6% | 9.8% | 75.4% | 1.47× |
10Azure Speech | 26.1% | 10.9% | 73.9% | 0.32× |
11Gemma 4Open source | 27.7% | 13.2% | 72.3% | 1.04× |
12OmniASR LLM-1BOpen source | 34.5% | 14.5% | 65.5% | 0.27× |
13Whisper medium MNOpen sourceOverlap | 35.1% | 14.8% | 64.9% | 2.71× |
14Whisper turbo MNOpen sourceOverlap | 37.6% | 14.1% | 62.4% | 2.59× |
15Whisper large-v3 MNOpen sourceOverlap | 41% | 17.1% | 59% | 1.58× |
16GPT-4o Transcribe | 44.3% | 23.7% | 55.7% | 2.62× |
17MMS-1B-allOpen source | 45.3% | 15.1% | 54.7% | 20.52× |
18Dolphin smallOpen source | 46.1% | 19% | 53.9% | 1.69× |
19W2v-BERT 2.0 MNOpen sourceOverlap | 46.3% | 18.2% | 53.7% | 28.12× |
20OmniASR CTC-1BOpen source | 54.9% | 18.9% | 45.1% | 0.59× |
21wav2vec2 XLSR-53 MNOpen sourceOverlap | 56.3% | 23.9% | 43.7% | 45.7× |
22Whisper large-v3Open source | 87.3% | 36.6% | 12.7% | 1.55× |
23Gladia | 88.1% | 39.9% | 11.9% | 0.74× |
24Moonshine MNOpen sourceOverlap | 96.2% | 75.7% | 3.8% | 8.36× |
25Whisper large-v3-turboOpen source | 98.1% | 57.1% | 1.9% | 1.19× |
26Qwen3-ASR-Flash | 103.6% | 89.9% | -3.6% | 2.07× |
27OpenAI Whisper | 104.6% | 63.8% | -4.6% | 1.32× |
28VibeVoice ASROpen source | 110.1% | 64% | -10.1% | 0.4× |
Zelf opgenomen voor deze benchmark — audio wordt niet verspreid, alleen meetwaarden.