Tabla comparativa de voz a texto en mongol
wav2vec2 XLSR-53 MNPunto operativo: anton-l/wav2vec2-large-xlsr-53-mongolian (CTC) on mps

wav2vec2 XLSR-53 MN — Benchmark de voz a texto en mongol

Resultados reales de la wav2vec2 XLSR-53 MN Batch API (punto de operación mejorado, idioma mn) evaluados en 4 conjuntos de datos en mongol y 265 muestras de audio. Todos los números de abajo son medidos, no marketing. WER, velocidad y precio se muestran tal cual, brutalmente honestos.

Idioma:MNDiarización:noneMuestras:265Ejecución:Aug 18, 2026, 5:41 PMEndpoint:local (transformers)
06710055%
Precisión

265/265 muestras transcritas · 100% de éxito

06710045%
Tasa de error de palabras

Menor es mejor · en 265 muestras

Métricas principales
Tasa de error de caracteres16.4%
Factor de velocidad medio42.32×múltiplo de tiempo real
Factor de velocidad total42.32×
Latencia media por muestra0.2s
Audio total procesado1849.3s30.8 min

Precio

Precio de lista de wav2vec2 XLSR-53 MN para transcripción por lotes. Sin descuentos ni tarifas negociadas: la tarifa bruta por minuto.

Por 1000 minutos
$0
lotes
Por minuto
$0.0000
efectivo
Por 1000 min (estos 30.8 min)
$0.00
costaría
¿Código abierto?
propietario

Fuente del precio: precios públicos de wav2vec2 XLSR-53 MN. Duudlaga Flow se muestra solo como contexto; esta página aísla wav2vec2 XLSR-53 MN para que el número no esté inflado por nuestro producto.

WER y CER por conjunto de datos

Tasas de error de palabras y caracteres por conjunto de datos. Menor es mejor — y estos son los números reales de wav2vec2 XLSR-53 MN, que son débiles en Common Voice 24.

Common Voice 24 (MN)
Conjunto de datos original →
WER
37.2%
CER
11.4%
Shunya Labs Mongolian Speech
Conjunto de datos original →
WER
44.6%
CER
15.3%
Common Voice 20 (MN)
Conjunto de datos original →
WER
31.7%
CER
9.6%
Modern Voice
WER
58%
CER
24.3%
WERCER

Resumen por conjunto de datos

Precisión, velocidad y tiempos agregados de cada conjunto de datos.

Conjunto de datosOrigenMuestrasÉxitoWERCERPrecisiónVelocidadAudio (s)Proc. (s)
Common Voice 24 (MN)Hugging Face →5959/5937.2%11.4%62.8%37.32×330.6s8.9s
Shunya Labs Mongolian SpeechHugging Face →6060/6044.6%15.3%55.4%45.18×645.1s14.3s
Common Voice 20 (MN)Hugging Face →5454/5431.7%9.6%68.3%37.72×269.8s7.2s
Modern Voice9292/9258%24.3%42.0%45.1×603.8s13.4s

WER frente a velocidad — por muestra

Cada punto es una muestra de audio. El punto ideal es abajo a la izquierda (poco error, rápido). wav2vec2 XLSR-53 MN tiene un error alto en muchas muestras de Common Voice 24.

Resultados por muestra

La verdad fundamental se muestra tal cual en la columna Esperado. La columna de resultado resalta en rojo solo las palabras que wav2vec2 XLSR-53 MN erró — sin tachados ni reemplazos, solo los errores.

265 filas
rojopalabra errónea en el resultadonormaltranscrito correctamenteLa columna Esperado se muestra tal cual como verdad fundamental
#AudioMuestraConjunto de datosEsperado (verdad fundamental)Resultado de wav2vec2 XLSR-53 MNWERCERI/D/S
1btsee_0001Common Voice 24 (MN)Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье.гэхдээ амьсгал хураахаасаа өмнө танд мэдэж ягаагаа хэлэе25.0%6.9%0/0/2
2btsee_0002Common Voice 24 (MN)Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү?надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж хүү8.3%1.3%0/0/1
3btsee_0003Common Voice 24 (MN)Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе.одоо бид өөрждөө өвчин эмгийдээсээ салахыг хичээцгээ гийдэг57.1%21.2%1/0/3
4btsee_0004Common Voice 24 (MN)Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн.би бол голдуу хээрээр гэр хэчээр дэр хийж явдаг хүн10.0%2.0%0/0/1
5btsee_0005Common Voice 24 (MN)Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ.тав хурамжт уулаж болдоггүй бур вгүн хоёр луугаар нэргүүл хэрэгүлжээ90.0%29.9%0/0/9
6btsee_0006Common Voice 24 (MN)Алив наашаа ороод ир гээд гэртээ оров.алив наашаа оройдр гээд гэртээ оров28.6%8.1%0/1/1
7btsee_0007Common Voice 24 (MN)Өө өндөр дээдэс таны тухайд би баталж чадахгүй.өө өндөр дээд таны тухайд би баталж чадахгүй12.5%4.3%0/0/1
8btsee_0008Common Voice 24 (MN)Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.харин гурав даг удаагаас эхлэх хүмүүсийг сонирхож эхлэв25.0%5.4%0/0/2
9btsee_0009Common Voice 24 (MN)Та нар очингуутаа шөл л өгч үз.та нар очингуутаа шүлэл өгч үз28.6%6.7%0/1/1
10btsee_0010Common Voice 24 (MN)Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь.ерөөсөө л үйлдвэрээсээ салуугүй орсон юм чинь42.9%16.7%0/0/3
Página 1 de 27

Metodología

Cómo se obtuvieron estos números.

Proveedor: wav2vec2 XLSR-53 MN (wav2vec2 XLSR-53 fine-tuned on Mongolian Common Voice — by download count the most-used Mongolian-specific open ASR model on the Hub. CTC output, so no punctuation or casing.). Los modelos con esta insignia se entrenaron con datos que se solapan con los corpus del benchmark (Common Voice en mongol —113 de 173 muestras— o el corpus público de Shunya Labs). Las puntuaciones en corpus solapados están infladas por memorización; juzga estos modelos por la tabla por conjunto de datos de su página de detalles, sobre todo por los corpus con los que NO se entrenaron.

Endpoint local (transformers). Idioma mn. Punto operativo anton-l/wav2vec2-large-xlsr-53-mongolian (CTC) on mps. Diarización none.

Conjuntos de datos: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 muestras, 1849.3s de audio en total.

URL de origen de los conjuntos de datos:

Métricas: WER y CER se calculan con una alineación Levenshtein de palabras/caracteres estándar, normalizada por mayúsculas y puntuación. Precisión = 100 − WER. Factor de velocidad = duración de audio ÷ tiempo de procesamiento (× tiempo real). Todas las solicitudes son llamadas reales a la Batch API de wav2vec2 XLSR-53 MN, no en caché ni simuladas.

Resaltado de diferencias: La columna de resultado se alinea con la verdad fundamental y colorea en rojo cada sustitución e inserción. Las eliminaciones (palabras que faltan en el resultado) no se muestran en la columna de resultado — la columna Esperado ya contiene toda la verdad fundamental tal cual.

Generado por wav2vec2 XLSR-53 MN Benchmark Runner · wav2vec2 XLSR-53 MN Batch API v2 · ejecutado Aug 18, 2026, 5:41 PM