Tabla comparativa de voz a texto en mongol

Compara la tasa de error de palabras, la velocidad y el precio de los proveedores de voz a texto para mongol. Cada número se mide en audio mongol real — no marketing.

Conjuntos de datos usados

Corpus de voz públicos usados en cada ejecución de proveedor. Abre una URL de origen para ver la ficha del conjunto de datos, su licencia y la descarga.

WER frente a velocidad

Cada punto es un proveedor. El punto ideal es abajo a la derecha (poco error, rápido). Medido en audio mongol real.

Google STTDuudlaga FlowSpeechmaticsChimegeOpenAI WhisperGPT-4o TranscribeAzure SpeechGladiaGemma 4Whisper large-v3Whisper large-v3-turboWhisper large-v2 MNSeamlessM4T v2MMS-1B-allMoonshine MNwav2vec2 XLSR-53 MNWhisper turbo MNWhisper medium MNElevenLabs Scribe v1ElevenLabs Scribe v2Qwen3-ASR-FlashDolphin smallOmniASR CTC-1BOmniASR LLM-1BVibeVoice ASRWhisper large-v3 MN

Comparación de proveedores

Ordena cualquier columna. Haz clic en Detalles para el desglose por muestra, precios y metodología de un proveedor.

ProveedorWERCERPrecisiónVelocidadLatenciaPrecio / 1000 min
Speechmatics
14.4%7.4%85.6%0.51×13.8s$8.5Detalles
Duudlaga FlowNuestro
14.6%7.6%85.4%1.47×5.2s$19.4Detalles
Chimege
14.6%6.6%85.4%1.51×4.7s$11.1Detalles
Google STT
16.9%7.4%83.1%1.98×3.7s$16Detalles
Whisper large-v2 MN
20.7%8.3%79.3%0.53×13.5s$0Detalles
Azure Speech
20.8%9.7%79.2%0.39×17.3s$16.7Detalles
Whisper medium MNSolapamiento
22.5%8.9%77.5%2.7×2.7s$0Detalles
SeamlessM4T v2
24%11.1%76%0.39×26.3s$0Detalles
Whisper turbo MNSolapamiento
25.7%9.2%74.3%2.43×3.0s$0Detalles
ElevenLabs Scribe v1
27.1%10.8%72.9%2.14×3.3s$6.7Detalles
ElevenLabs Scribe v2
27.1%10.6%72.9%1.51×4.7s$3.7Detalles
Gemma 4
30.2%14.7%69.8%1×7.3s$0Detalles
OmniASR LLM-1B
33.8%14.2%66.2%0.27×26.6s$0Detalles
Whisper large-v3 MNSolapamiento
39.4%14.9%60.6%1.57×4.5s$0Detalles
MMS-1B-all
41.7%12.3%58.3%19.2×0.4s$0Detalles
wav2vec2 XLSR-53 MNSolapamiento
45%16.4%55%42.32×0.2s$0Detalles
Dolphin small
49.1%19.2%50.9%1.73×4.1s$0Detalles
OmniASR CTC-1B
51.2%15.5%48.8%0.6×11.7s$0Detalles
GPT-4o Transcribe
53%27.6%47%2.11×3.7s$6Detalles
Moonshine MNSolapamiento
58.8%45.2%41.2%8.44×0.8s$0Detalles
Whisper large-v3
89.5%37.4%10.5%1.29×6.0s$0Detalles
Gladia
90.1%38.9%9.9%0.75×9.4s$10.2Detalles
Whisper large-v3-turbo
99%54.4%1%0.91×8.7s$0Detalles
Qwen3-ASR-Flash
103.7%86.4%-3.7%2.19×3.2s$2.1Detalles
OpenAI Whisper
105.2%63.7%-5.2%1.5×4.5s$6Detalles
VibeVoice ASR
107%61%-7%0.53×12.1s$0Detalles
Gemini Flash
Benchmark próximamente

Todos los resultados se miden en datasets mongoles reales. La velocidad es × tiempo real (más alto es más rápido). Un WER más bajo es mejor.

SolapamientoLos modelos con esta insignia se entrenaron con datos que se solapan con los corpus del benchmark (Common Voice en mongol —113 de 173 muestras— o el corpus público de Shunya Labs). Las puntuaciones en corpus solapados están infladas por memorización; juzga estos modelos por la tabla por conjunto de datos de su página de detalles, sobre todo por los corpus con los que NO se entrenaron.

Duudlaga Voice Set

92 samples · 10.2 min · 28 systems

A second corpus recorded first-party for this benchmark, covering what the public Mongolian datasets barely contain: modern loanwords, English/Mongolian code-switching, numbers, dates, and commands. Every system is measured on the same 92 recordings.

ProveedorWERCERPrecisiónVelocidad
1Duudlaga FlowNuestro
9.5%5.3%90.5%1.27×
2Google STT
11.7%5.5%88.3%2.28×
3Chimege
14.5%6.8%85.5%1.48×
4Speechmatics
15.3%7.6%84.7%0.5×
5Gemini 3.5 Flash
19.5%11.4%80.5%0.06×
6SeamlessM4T v2Código abierto
22.9%10.4%77.1%4.32×
7Whisper large-v2 MNCódigo abierto
23.2%10.9%76.8%0.55×
8ElevenLabs Scribe v1
23.4%9.3%76.6%2.09×
9ElevenLabs Scribe v2
24.6%9.8%75.4%1.47×
10Azure Speech
26.1%10.9%73.9%0.32×
11Gemma 4Código abierto
27.7%13.2%72.3%1.04×
12OmniASR LLM-1BCódigo abierto
34.5%14.5%65.5%0.27×
13Whisper medium MNCódigo abiertoSolapamiento
35.1%14.8%64.9%2.71×
14Whisper turbo MNCódigo abiertoSolapamiento
37.6%14.1%62.4%2.59×
15Whisper large-v3 MNCódigo abiertoSolapamiento
41%17.1%59%1.58×
16GPT-4o Transcribe
44.3%23.7%55.7%2.62×
17MMS-1B-allCódigo abierto
45.3%15.1%54.7%20.52×
18Dolphin smallCódigo abierto
46.1%19%53.9%1.69×
19W2v-BERT 2.0 MNCódigo abiertoSolapamiento
46.3%18.2%53.7%28.12×
20OmniASR CTC-1BCódigo abierto
54.9%18.9%45.1%0.59×
21wav2vec2 XLSR-53 MNCódigo abiertoSolapamiento
56.3%23.9%43.7%45.7×
22Whisper large-v3Código abierto
87.3%36.6%12.7%1.55×
23Gladia
88.1%39.9%11.9%0.74×
24Moonshine MNCódigo abiertoSolapamiento
96.2%75.7%3.8%8.36×
25Whisper large-v3-turboCódigo abierto
98.1%57.1%1.9%1.19×
26Qwen3-ASR-Flash
103.6%89.9%-3.6%2.07×
27OpenAI Whisper
104.6%63.8%-4.6%1.32×
28VibeVoice ASRCódigo abierto
110.1%64%-10.1%0.4×

Grabado por nosotros para este benchmark: el audio no se distribuye, solo las métricas.