Classifica di voce in testo in mongolo

Confronta il tasso di errore delle parole, la velocità e il prezzo dei provider di voce in testo per il mongolo. Ogni numero è misurato su audio mongolo reale — non marketing.

Dataset utilizzati

Corpora vocali pubblici utilizzati per ogni esecuzione dei provider. Apri l’URL di origine per consultare la scheda del dataset originale, la licenza e il download.

WER vs velocità

Ogni punto è un provider. L'ideale è in basso a destra (poco errore, veloce). Misurato su audio mongolo reale.

Google STTDuudlaga FlowSpeechmaticsChimegeOpenAI WhisperGPT-4o TranscribeAzure SpeechGladiaGemma 4Whisper large-v3Whisper large-v3-turboWhisper large-v2 MNSeamlessM4T v2MMS-1B-allMoonshine MNwav2vec2 XLSR-53 MNWhisper turbo MNWhisper medium MNElevenLabs Scribe v1ElevenLabs Scribe v2Qwen3-ASR-FlashDolphin smallOmniASR CTC-1BOmniASR LLM-1BVibeVoice ASRWhisper large-v3 MN

Confronto provider

Ordina qualsiasi colonna. Clicca Dettagli per il dettaglio per campione, prezzi e metodologia di un provider.

ProviderWERCERAccuratezzaVelocitàLatenzaPrezzo / 1000 min
Speechmatics
14.4%7.4%85.6%0.51×13.8s$8.5Dettagli
Duudlaga FlowNostro
14.6%7.6%85.4%1.47×5.2s$19.4Dettagli
Chimege
14.6%6.6%85.4%1.51×4.7s$11.1Dettagli
Google STT
16.9%7.4%83.1%1.98×3.7s$16Dettagli
Whisper large-v2 MN
20.7%8.3%79.3%0.53×13.5s$0Dettagli
Azure Speech
20.8%9.7%79.2%0.39×17.3s$16.7Dettagli
Whisper medium MNSovrapposizione
22.5%8.9%77.5%2.7×2.7s$0Dettagli
SeamlessM4T v2
24%11.1%76%0.39×26.3s$0Dettagli
Whisper turbo MNSovrapposizione
25.7%9.2%74.3%2.43×3.0s$0Dettagli
ElevenLabs Scribe v1
27.1%10.8%72.9%2.14×3.3s$6.7Dettagli
ElevenLabs Scribe v2
27.1%10.6%72.9%1.51×4.7s$3.7Dettagli
Gemma 4
30.2%14.7%69.8%1×7.3s$0Dettagli
OmniASR LLM-1B
33.8%14.2%66.2%0.27×26.6s$0Dettagli
Whisper large-v3 MNSovrapposizione
39.4%14.9%60.6%1.57×4.5s$0Dettagli
MMS-1B-all
41.7%12.3%58.3%19.2×0.4s$0Dettagli
wav2vec2 XLSR-53 MNSovrapposizione
45%16.4%55%42.32×0.2s$0Dettagli
Dolphin small
49.1%19.2%50.9%1.73×4.1s$0Dettagli
OmniASR CTC-1B
51.2%15.5%48.8%0.6×11.7s$0Dettagli
GPT-4o Transcribe
53%27.6%47%2.11×3.7s$6Dettagli
Moonshine MNSovrapposizione
58.8%45.2%41.2%8.44×0.8s$0Dettagli
Whisper large-v3
89.5%37.4%10.5%1.29×6.0s$0Dettagli
Gladia
90.1%38.9%9.9%0.75×9.4s$10.2Dettagli
Whisper large-v3-turbo
99%54.4%1%0.91×8.7s$0Dettagli
Qwen3-ASR-Flash
103.7%86.4%-3.7%2.19×3.2s$2.1Dettagli
OpenAI Whisper
105.2%63.7%-5.2%1.5×4.5s$6Dettagli
VibeVoice ASR
107%61%-7%0.53×12.1s$0Dettagli
Gemini Flash
Benchmark in arrivo

Tutti i risultati sono misurati su dataset mongoli reali. La velocità è × tempo reale (più alto = più veloce). WER più basso è meglio.

SovrapposizioneI modelli con questo badge sono stati addestrati su dati che si sovrappongono ai corpora di benchmark (Mongolian Common Voice — 113 campioni su 173 — o il corpus pubblico di Shunya Labs). I punteggi sui corpora sovrapposti sono gonfiati dalla memorizzazione; valuta questi modelli tramite la tabella per dataset nella pagina dei dettagli, soprattutto sui corpora sui quali NON sono stati addestrati.

Duudlaga Voice Set

92 samples · 10.2 min · 28 systems

A second corpus recorded first-party for this benchmark, covering what the public Mongolian datasets barely contain: modern loanwords, English/Mongolian code-switching, numbers, dates, and commands. Every system is measured on the same 92 recordings.

ProviderWERCERAccuratezzaVelocità
1Duudlaga FlowNostro
9.5%5.3%90.5%1.27×
2Google STT
11.7%5.5%88.3%2.28×
3Chimege
14.5%6.8%85.5%1.48×
4Speechmatics
15.3%7.6%84.7%0.5×
5Gemini 3.5 Flash
19.5%11.4%80.5%0.06×
6SeamlessM4T v2Open source
22.9%10.4%77.1%4.32×
7Whisper large-v2 MNOpen source
23.2%10.9%76.8%0.55×
8ElevenLabs Scribe v1
23.4%9.3%76.6%2.09×
9ElevenLabs Scribe v2
24.6%9.8%75.4%1.47×
10Azure Speech
26.1%10.9%73.9%0.32×
11Gemma 4Open source
27.7%13.2%72.3%1.04×
12OmniASR LLM-1BOpen source
34.5%14.5%65.5%0.27×
13Whisper medium MNOpen sourceSovrapposizione
35.1%14.8%64.9%2.71×
14Whisper turbo MNOpen sourceSovrapposizione
37.6%14.1%62.4%2.59×
15Whisper large-v3 MNOpen sourceSovrapposizione
41%17.1%59%1.58×
16GPT-4o Transcribe
44.3%23.7%55.7%2.62×
17MMS-1B-allOpen source
45.3%15.1%54.7%20.52×
18Dolphin smallOpen source
46.1%19%53.9%1.69×
19W2v-BERT 2.0 MNOpen sourceSovrapposizione
46.3%18.2%53.7%28.12×
20OmniASR CTC-1BOpen source
54.9%18.9%45.1%0.59×
21wav2vec2 XLSR-53 MNOpen sourceSovrapposizione
56.3%23.9%43.7%45.7×
22Whisper large-v3Open source
87.3%36.6%12.7%1.55×
23Gladia
88.1%39.9%11.9%0.74×
24Moonshine MNOpen sourceSovrapposizione
96.2%75.7%3.8%8.36×
25Whisper large-v3-turboOpen source
98.1%57.1%1.9%1.19×
26Qwen3-ASR-Flash
103.6%89.9%-3.6%2.07×
27OpenAI Whisper
104.6%63.8%-4.6%1.32×
28VibeVoice ASROpen source
110.1%64%-10.1%0.4×

Registrato direttamente per questo benchmark — audio non distribuito, solo metriche.