Classement de reconnaissance vocale en mongol
Comparez le taux d'erreur par mot, la vitesse et le prix des fournisseurs de reconnaissance vocale pour le mongol. Chaque chiffre est mesuré sur de l'audio mongol réel — pas du marketing.
Jeux de données utilisés
Corpus de parole publics utilisés pour chaque exécution de fournisseur. Ouvrez une URL source pour la fiche du jeu de données, sa licence et son téléchargement.
- Common Voice 24 (MN)›https://huggingface.co/datasets/btsee/common-voices-24-mn
- Shunya Labs Mongolian Speech›https://huggingface.co/datasets/shunyalabs/mongolian-speech-dataset
- Common Voice 20 (MN)›https://huggingface.co/datasets/warmestman/common-voice-20-mn-normalized
- Modern Voice›Enregistré par nos soins pour ce benchmark — audio non distribué, métriques uniquement.
WER vs vitesse
Chaque point est un fournisseur. L'idéal est en bas à droite (peu d'erreurs, rapide). Mesuré sur de l'audio mongol réel.
Comparaison des fournisseurs
Triez n'importe quelle colonne. Cliquez sur Détails pour le détail par échantillon, les prix et la méthodologie d'un fournisseur.
| Fournisseur | WER ↑ | CER | Précision | Vitesse | Latence | Prix / 1000 min | |
|---|---|---|---|---|---|---|---|
Speechmatics | 14.4% | 7.4% | 85.6% | 0.51× | 13.8s | $8.5 | Détails |
Duudlaga FlowLe nôtre | 14.6% | 7.6% | 85.4% | 1.47× | 5.2s | $19.4 | Détails |
Chimege | 14.6% | 6.6% | 85.4% | 1.51× | 4.7s | $11.1 | Détails |
Google STT | 16.9% | 7.4% | 83.1% | 1.98× | 3.7s | $16 | Détails |
Whisper large-v2 MN | 20.7% | 8.3% | 79.3% | 0.53× | 13.5s | $0 | Détails |
Azure Speech | 20.8% | 9.7% | 79.2% | 0.39× | 17.3s | $16.7 | Détails |
Whisper medium MNRecoupement | 22.5% | 8.9% | 77.5% | 2.7× | 2.7s | $0 | Détails |
SeamlessM4T v2 | 24% | 11.1% | 76% | 0.39× | 26.3s | $0 | Détails |
Whisper turbo MNRecoupement | 25.7% | 9.2% | 74.3% | 2.43× | 3.0s | $0 | Détails |
ElevenLabs Scribe v1 | 27.1% | 10.8% | 72.9% | 2.14× | 3.3s | $6.7 | Détails |
ElevenLabs Scribe v2 | 27.1% | 10.6% | 72.9% | 1.51× | 4.7s | $3.7 | Détails |
Gemma 4 | 30.2% | 14.7% | 69.8% | 1× | 7.3s | $0 | Détails |
OmniASR LLM-1B | 33.8% | 14.2% | 66.2% | 0.27× | 26.6s | $0 | Détails |
Whisper large-v3 MNRecoupement | 39.4% | 14.9% | 60.6% | 1.57× | 4.5s | $0 | Détails |
MMS-1B-all | 41.7% | 12.3% | 58.3% | 19.2× | 0.4s | $0 | Détails |
wav2vec2 XLSR-53 MNRecoupement | 45% | 16.4% | 55% | 42.32× | 0.2s | $0 | Détails |
Dolphin small | 49.1% | 19.2% | 50.9% | 1.73× | 4.1s | $0 | Détails |
OmniASR CTC-1B | 51.2% | 15.5% | 48.8% | 0.6× | 11.7s | $0 | Détails |
GPT-4o Transcribe | 53% | 27.6% | 47% | 2.11× | 3.7s | $6 | Détails |
Moonshine MNRecoupement | 58.8% | 45.2% | 41.2% | 8.44× | 0.8s | $0 | Détails |
Whisper large-v3 | 89.5% | 37.4% | 10.5% | 1.29× | 6.0s | $0 | Détails |
Gladia | 90.1% | 38.9% | 9.9% | 0.75× | 9.4s | $10.2 | Détails |
Whisper large-v3-turbo | 99% | 54.4% | 1% | 0.91× | 8.7s | $0 | Détails |
Qwen3-ASR-Flash | 103.7% | 86.4% | -3.7% | 2.19× | 3.2s | $2.1 | Détails |
OpenAI Whisper | 105.2% | 63.7% | -5.2% | 1.5× | 4.5s | $6 | Détails |
VibeVoice ASR | 107% | 61% | -7% | 0.53× | 12.1s | $0 | Détails |
Gemini Flash | Benchmark bientôt disponible | ||||||
Tous les résultats sont mesurés sur des jeux de données mongols réels. La vitesse est × temps réel (plus haut = plus rapide). Un WER plus bas est meilleur.
Recoupement— Les modèles portant ce badge ont été entraînés sur des données qui recoupent les corpus du benchmark (Common Voice en mongol — 113 échantillons sur 173 — ou le corpus public de Shunya Labs). Les scores sur les corpus recoupés sont gonflés par la mémorisation ; jugez ces modèles sur le tableau par jeu de données de leur page de détails, en particulier sur les corpus sur lesquels ils n'ont PAS été entraînés.
Duudlaga Voice Set
92 samples · 10.2 min · 28 systemsA second corpus recorded first-party for this benchmark, covering what the public Mongolian datasets barely contain: modern loanwords, English/Mongolian code-switching, numbers, dates, and commands. Every system is measured on the same 92 recordings.
| Fournisseur | WER | CER | Précision | Vitesse |
|---|---|---|---|---|
1Duudlaga FlowLe nôtre | 9.5% | 5.3% | 90.5% | 1.27× |
2Google STT | 11.7% | 5.5% | 88.3% | 2.28× |
3Chimege | 14.5% | 6.8% | 85.5% | 1.48× |
4Speechmatics | 15.3% | 7.6% | 84.7% | 0.5× |
5Gemini 3.5 Flash | 19.5% | 11.4% | 80.5% | 0.06× |
6SeamlessM4T v2Open source | 22.9% | 10.4% | 77.1% | 4.32× |
7Whisper large-v2 MNOpen source | 23.2% | 10.9% | 76.8% | 0.55× |
8ElevenLabs Scribe v1 | 23.4% | 9.3% | 76.6% | 2.09× |
9ElevenLabs Scribe v2 | 24.6% | 9.8% | 75.4% | 1.47× |
10Azure Speech | 26.1% | 10.9% | 73.9% | 0.32× |
11Gemma 4Open source | 27.7% | 13.2% | 72.3% | 1.04× |
12OmniASR LLM-1BOpen source | 34.5% | 14.5% | 65.5% | 0.27× |
13Whisper medium MNOpen sourceRecoupement | 35.1% | 14.8% | 64.9% | 2.71× |
14Whisper turbo MNOpen sourceRecoupement | 37.6% | 14.1% | 62.4% | 2.59× |
15Whisper large-v3 MNOpen sourceRecoupement | 41% | 17.1% | 59% | 1.58× |
16GPT-4o Transcribe | 44.3% | 23.7% | 55.7% | 2.62× |
17MMS-1B-allOpen source | 45.3% | 15.1% | 54.7% | 20.52× |
18Dolphin smallOpen source | 46.1% | 19% | 53.9% | 1.69× |
19W2v-BERT 2.0 MNOpen sourceRecoupement | 46.3% | 18.2% | 53.7% | 28.12× |
20OmniASR CTC-1BOpen source | 54.9% | 18.9% | 45.1% | 0.59× |
21wav2vec2 XLSR-53 MNOpen sourceRecoupement | 56.3% | 23.9% | 43.7% | 45.7× |
22Whisper large-v3Open source | 87.3% | 36.6% | 12.7% | 1.55× |
23Gladia | 88.1% | 39.9% | 11.9% | 0.74× |
24Moonshine MNOpen sourceRecoupement | 96.2% | 75.7% | 3.8% | 8.36× |
25Whisper large-v3-turboOpen source | 98.1% | 57.1% | 1.9% | 1.19× |
26Qwen3-ASR-Flash | 103.6% | 89.9% | -3.6% | 2.07× |
27OpenAI Whisper | 104.6% | 63.8% | -4.6% | 1.32× |
28VibeVoice ASROpen source | 110.1% | 64% | -10.1% | 0.4× |
Enregistré par nos soins pour ce benchmark — audio non distribué, métriques uniquement.