Tabla comparativa de voz a texto en mongol
Compara la tasa de error de palabras, la velocidad y el precio de los proveedores de voz a texto para mongol. Cada número se mide en audio mongol real — no marketing.
Conjuntos de datos usados
Corpus de voz públicos usados en cada ejecución de proveedor. Abre una URL de origen para ver la ficha del conjunto de datos, su licencia y la descarga.
- Common Voice 24 (MN)›https://huggingface.co/datasets/btsee/common-voices-24-mn
- Shunya Labs Mongolian Speech›https://huggingface.co/datasets/shunyalabs/mongolian-speech-dataset
- Common Voice 20 (MN)›https://huggingface.co/datasets/warmestman/common-voice-20-mn-normalized
- Modern Voice›Grabado por nosotros para este benchmark: el audio no se distribuye, solo las métricas.
WER frente a velocidad
Cada punto es un proveedor. El punto ideal es abajo a la derecha (poco error, rápido). Medido en audio mongol real.
Comparación de proveedores
Ordena cualquier columna. Haz clic en Detalles para el desglose por muestra, precios y metodología de un proveedor.
| Proveedor | WER ↑ | CER | Precisión | Velocidad | Latencia | Precio / 1000 min | |
|---|---|---|---|---|---|---|---|
Speechmatics | 14.4% | 7.4% | 85.6% | 0.51× | 13.8s | $8.5 | Detalles |
Duudlaga FlowNuestro | 14.6% | 7.6% | 85.4% | 1.47× | 5.2s | $19.4 | Detalles |
Chimege | 14.6% | 6.6% | 85.4% | 1.51× | 4.7s | $11.1 | Detalles |
Google STT | 16.9% | 7.4% | 83.1% | 1.98× | 3.7s | $16 | Detalles |
Whisper large-v2 MN | 20.7% | 8.3% | 79.3% | 0.53× | 13.5s | $0 | Detalles |
Azure Speech | 20.8% | 9.7% | 79.2% | 0.39× | 17.3s | $16.7 | Detalles |
Whisper medium MNSolapamiento | 22.5% | 8.9% | 77.5% | 2.7× | 2.7s | $0 | Detalles |
SeamlessM4T v2 | 24% | 11.1% | 76% | 0.39× | 26.3s | $0 | Detalles |
Whisper turbo MNSolapamiento | 25.7% | 9.2% | 74.3% | 2.43× | 3.0s | $0 | Detalles |
ElevenLabs Scribe v1 | 27.1% | 10.8% | 72.9% | 2.14× | 3.3s | $6.7 | Detalles |
ElevenLabs Scribe v2 | 27.1% | 10.6% | 72.9% | 1.51× | 4.7s | $3.7 | Detalles |
Gemma 4 | 30.2% | 14.7% | 69.8% | 1× | 7.3s | $0 | Detalles |
OmniASR LLM-1B | 33.8% | 14.2% | 66.2% | 0.27× | 26.6s | $0 | Detalles |
Whisper large-v3 MNSolapamiento | 39.4% | 14.9% | 60.6% | 1.57× | 4.5s | $0 | Detalles |
MMS-1B-all | 41.7% | 12.3% | 58.3% | 19.2× | 0.4s | $0 | Detalles |
wav2vec2 XLSR-53 MNSolapamiento | 45% | 16.4% | 55% | 42.32× | 0.2s | $0 | Detalles |
Dolphin small | 49.1% | 19.2% | 50.9% | 1.73× | 4.1s | $0 | Detalles |
OmniASR CTC-1B | 51.2% | 15.5% | 48.8% | 0.6× | 11.7s | $0 | Detalles |
GPT-4o Transcribe | 53% | 27.6% | 47% | 2.11× | 3.7s | $6 | Detalles |
Moonshine MNSolapamiento | 58.8% | 45.2% | 41.2% | 8.44× | 0.8s | $0 | Detalles |
Whisper large-v3 | 89.5% | 37.4% | 10.5% | 1.29× | 6.0s | $0 | Detalles |
Gladia | 90.1% | 38.9% | 9.9% | 0.75× | 9.4s | $10.2 | Detalles |
Whisper large-v3-turbo | 99% | 54.4% | 1% | 0.91× | 8.7s | $0 | Detalles |
Qwen3-ASR-Flash | 103.7% | 86.4% | -3.7% | 2.19× | 3.2s | $2.1 | Detalles |
OpenAI Whisper | 105.2% | 63.7% | -5.2% | 1.5× | 4.5s | $6 | Detalles |
VibeVoice ASR | 107% | 61% | -7% | 0.53× | 12.1s | $0 | Detalles |
Gemini Flash | Benchmark próximamente | ||||||
Todos los resultados se miden en datasets mongoles reales. La velocidad es × tiempo real (más alto es más rápido). Un WER más bajo es mejor.
Solapamiento— Los modelos con esta insignia se entrenaron con datos que se solapan con los corpus del benchmark (Common Voice en mongol —113 de 173 muestras— o el corpus público de Shunya Labs). Las puntuaciones en corpus solapados están infladas por memorización; juzga estos modelos por la tabla por conjunto de datos de su página de detalles, sobre todo por los corpus con los que NO se entrenaron.
Duudlaga Voice Set
92 samples · 10.2 min · 28 systemsA second corpus recorded first-party for this benchmark, covering what the public Mongolian datasets barely contain: modern loanwords, English/Mongolian code-switching, numbers, dates, and commands. Every system is measured on the same 92 recordings.
| Proveedor | WER | CER | Precisión | Velocidad |
|---|---|---|---|---|
1Duudlaga FlowNuestro | 9.5% | 5.3% | 90.5% | 1.27× |
2Google STT | 11.7% | 5.5% | 88.3% | 2.28× |
3Chimege | 14.5% | 6.8% | 85.5% | 1.48× |
4Speechmatics | 15.3% | 7.6% | 84.7% | 0.5× |
5Gemini 3.5 Flash | 19.5% | 11.4% | 80.5% | 0.06× |
6SeamlessM4T v2Código abierto | 22.9% | 10.4% | 77.1% | 4.32× |
7Whisper large-v2 MNCódigo abierto | 23.2% | 10.9% | 76.8% | 0.55× |
8ElevenLabs Scribe v1 | 23.4% | 9.3% | 76.6% | 2.09× |
9ElevenLabs Scribe v2 | 24.6% | 9.8% | 75.4% | 1.47× |
10Azure Speech | 26.1% | 10.9% | 73.9% | 0.32× |
11Gemma 4Código abierto | 27.7% | 13.2% | 72.3% | 1.04× |
12OmniASR LLM-1BCódigo abierto | 34.5% | 14.5% | 65.5% | 0.27× |
13Whisper medium MNCódigo abiertoSolapamiento | 35.1% | 14.8% | 64.9% | 2.71× |
14Whisper turbo MNCódigo abiertoSolapamiento | 37.6% | 14.1% | 62.4% | 2.59× |
15Whisper large-v3 MNCódigo abiertoSolapamiento | 41% | 17.1% | 59% | 1.58× |
16GPT-4o Transcribe | 44.3% | 23.7% | 55.7% | 2.62× |
17MMS-1B-allCódigo abierto | 45.3% | 15.1% | 54.7% | 20.52× |
18Dolphin smallCódigo abierto | 46.1% | 19% | 53.9% | 1.69× |
19W2v-BERT 2.0 MNCódigo abiertoSolapamiento | 46.3% | 18.2% | 53.7% | 28.12× |
20OmniASR CTC-1BCódigo abierto | 54.9% | 18.9% | 45.1% | 0.59× |
21wav2vec2 XLSR-53 MNCódigo abiertoSolapamiento | 56.3% | 23.9% | 43.7% | 45.7× |
22Whisper large-v3Código abierto | 87.3% | 36.6% | 12.7% | 1.55× |
23Gladia | 88.1% | 39.9% | 11.9% | 0.74× |
24Moonshine MNCódigo abiertoSolapamiento | 96.2% | 75.7% | 3.8% | 8.36× |
25Whisper large-v3-turboCódigo abierto | 98.1% | 57.1% | 1.9% | 1.19× |
26Qwen3-ASR-Flash | 103.6% | 89.9% | -3.6% | 2.07× |
27OpenAI Whisper | 104.6% | 63.8% | -4.6% | 1.32× |
28VibeVoice ASRCódigo abierto | 110.1% | 64% | -10.1% | 0.4× |
Grabado por nosotros para este benchmark: el audio no se distribuye, solo las métricas.