Classifica di voce in testo in mongolo
Confronta il tasso di errore delle parole, la velocità e il prezzo dei provider di voce in testo per il mongolo. Ogni numero è misurato su audio mongolo reale — non marketing.
Dataset utilizzati
Corpora vocali pubblici utilizzati per ogni esecuzione dei provider. Apri l’URL di origine per consultare la scheda del dataset originale, la licenza e il download.
- Common Voice 24 (MN)›https://huggingface.co/datasets/btsee/common-voices-24-mn
- Shunya Labs Mongolian Speech›https://huggingface.co/datasets/shunyalabs/mongolian-speech-dataset
- Common Voice 20 (MN)›https://huggingface.co/datasets/warmestman/common-voice-20-mn-normalized
- Modern Voice›Registrato direttamente per questo benchmark — audio non distribuito, solo metriche.
WER vs velocità
Ogni punto è un provider. L'ideale è in basso a destra (poco errore, veloce). Misurato su audio mongolo reale.
Confronto provider
Ordina qualsiasi colonna. Clicca Dettagli per il dettaglio per campione, prezzi e metodologia di un provider.
| Provider | WER ↑ | CER | Accuratezza | Velocità | Latenza | Prezzo / 1000 min | |
|---|---|---|---|---|---|---|---|
Speechmatics | 14.4% | 7.4% | 85.6% | 0.51× | 13.8s | $8.5 | Dettagli |
Duudlaga FlowNostro | 14.6% | 7.6% | 85.4% | 1.47× | 5.2s | $19.4 | Dettagli |
Chimege | 14.6% | 6.6% | 85.4% | 1.51× | 4.7s | $11.1 | Dettagli |
Google STT | 16.9% | 7.4% | 83.1% | 1.98× | 3.7s | $16 | Dettagli |
Whisper large-v2 MN | 20.7% | 8.3% | 79.3% | 0.53× | 13.5s | $0 | Dettagli |
Azure Speech | 20.8% | 9.7% | 79.2% | 0.39× | 17.3s | $16.7 | Dettagli |
Whisper medium MNSovrapposizione | 22.5% | 8.9% | 77.5% | 2.7× | 2.7s | $0 | Dettagli |
SeamlessM4T v2 | 24% | 11.1% | 76% | 0.39× | 26.3s | $0 | Dettagli |
Whisper turbo MNSovrapposizione | 25.7% | 9.2% | 74.3% | 2.43× | 3.0s | $0 | Dettagli |
ElevenLabs Scribe v1 | 27.1% | 10.8% | 72.9% | 2.14× | 3.3s | $6.7 | Dettagli |
ElevenLabs Scribe v2 | 27.1% | 10.6% | 72.9% | 1.51× | 4.7s | $3.7 | Dettagli |
Gemma 4 | 30.2% | 14.7% | 69.8% | 1× | 7.3s | $0 | Dettagli |
OmniASR LLM-1B | 33.8% | 14.2% | 66.2% | 0.27× | 26.6s | $0 | Dettagli |
Whisper large-v3 MNSovrapposizione | 39.4% | 14.9% | 60.6% | 1.57× | 4.5s | $0 | Dettagli |
MMS-1B-all | 41.7% | 12.3% | 58.3% | 19.2× | 0.4s | $0 | Dettagli |
wav2vec2 XLSR-53 MNSovrapposizione | 45% | 16.4% | 55% | 42.32× | 0.2s | $0 | Dettagli |
Dolphin small | 49.1% | 19.2% | 50.9% | 1.73× | 4.1s | $0 | Dettagli |
OmniASR CTC-1B | 51.2% | 15.5% | 48.8% | 0.6× | 11.7s | $0 | Dettagli |
GPT-4o Transcribe | 53% | 27.6% | 47% | 2.11× | 3.7s | $6 | Dettagli |
Moonshine MNSovrapposizione | 58.8% | 45.2% | 41.2% | 8.44× | 0.8s | $0 | Dettagli |
Whisper large-v3 | 89.5% | 37.4% | 10.5% | 1.29× | 6.0s | $0 | Dettagli |
Gladia | 90.1% | 38.9% | 9.9% | 0.75× | 9.4s | $10.2 | Dettagli |
Whisper large-v3-turbo | 99% | 54.4% | 1% | 0.91× | 8.7s | $0 | Dettagli |
Qwen3-ASR-Flash | 103.7% | 86.4% | -3.7% | 2.19× | 3.2s | $2.1 | Dettagli |
OpenAI Whisper | 105.2% | 63.7% | -5.2% | 1.5× | 4.5s | $6 | Dettagli |
VibeVoice ASR | 107% | 61% | -7% | 0.53× | 12.1s | $0 | Dettagli |
Gemini Flash | Benchmark in arrivo | ||||||
Tutti i risultati sono misurati su dataset mongoli reali. La velocità è × tempo reale (più alto = più veloce). WER più basso è meglio.
Sovrapposizione— I modelli con questo badge sono stati addestrati su dati che si sovrappongono ai corpora di benchmark (Mongolian Common Voice — 113 campioni su 173 — o il corpus pubblico di Shunya Labs). I punteggi sui corpora sovrapposti sono gonfiati dalla memorizzazione; valuta questi modelli tramite la tabella per dataset nella pagina dei dettagli, soprattutto sui corpora sui quali NON sono stati addestrati.
Duudlaga Voice Set
92 samples · 10.2 min · 28 systemsA second corpus recorded first-party for this benchmark, covering what the public Mongolian datasets barely contain: modern loanwords, English/Mongolian code-switching, numbers, dates, and commands. Every system is measured on the same 92 recordings.
| Provider | WER | CER | Accuratezza | Velocità |
|---|---|---|---|---|
1Duudlaga FlowNostro | 9.5% | 5.3% | 90.5% | 1.27× |
2Google STT | 11.7% | 5.5% | 88.3% | 2.28× |
3Chimege | 14.5% | 6.8% | 85.5% | 1.48× |
4Speechmatics | 15.3% | 7.6% | 84.7% | 0.5× |
5Gemini 3.5 Flash | 19.5% | 11.4% | 80.5% | 0.06× |
6SeamlessM4T v2Open source | 22.9% | 10.4% | 77.1% | 4.32× |
7Whisper large-v2 MNOpen source | 23.2% | 10.9% | 76.8% | 0.55× |
8ElevenLabs Scribe v1 | 23.4% | 9.3% | 76.6% | 2.09× |
9ElevenLabs Scribe v2 | 24.6% | 9.8% | 75.4% | 1.47× |
10Azure Speech | 26.1% | 10.9% | 73.9% | 0.32× |
11Gemma 4Open source | 27.7% | 13.2% | 72.3% | 1.04× |
12OmniASR LLM-1BOpen source | 34.5% | 14.5% | 65.5% | 0.27× |
13Whisper medium MNOpen sourceSovrapposizione | 35.1% | 14.8% | 64.9% | 2.71× |
14Whisper turbo MNOpen sourceSovrapposizione | 37.6% | 14.1% | 62.4% | 2.59× |
15Whisper large-v3 MNOpen sourceSovrapposizione | 41% | 17.1% | 59% | 1.58× |
16GPT-4o Transcribe | 44.3% | 23.7% | 55.7% | 2.62× |
17MMS-1B-allOpen source | 45.3% | 15.1% | 54.7% | 20.52× |
18Dolphin smallOpen source | 46.1% | 19% | 53.9% | 1.69× |
19W2v-BERT 2.0 MNOpen sourceSovrapposizione | 46.3% | 18.2% | 53.7% | 28.12× |
20OmniASR CTC-1BOpen source | 54.9% | 18.9% | 45.1% | 0.59× |
21wav2vec2 XLSR-53 MNOpen sourceSovrapposizione | 56.3% | 23.9% | 43.7% | 45.7× |
22Whisper large-v3Open source | 87.3% | 36.6% | 12.7% | 1.55× |
23Gladia | 88.1% | 39.9% | 11.9% | 0.74× |
24Moonshine MNOpen sourceSovrapposizione | 96.2% | 75.7% | 3.8% | 8.36× |
25Whisper large-v3-turboOpen source | 98.1% | 57.1% | 1.9% | 1.19× |
26Qwen3-ASR-Flash | 103.6% | 89.9% | -3.6% | 2.07× |
27OpenAI Whisper | 104.6% | 63.8% | -4.6% | 1.32× |
28VibeVoice ASROpen source | 110.1% | 64% | -10.1% | 0.4× |
Registrato direttamente per questo benchmark — audio non distribuito, solo metriche.