VibeVoice ASR — Benchmark de voz a texto en mongol
Resultados reales de la VibeVoice ASR Batch API (punto de operación mejorado, idioma mn) evaluados en 4 conjuntos de datos en mongol y 265 muestras de audio. Todos los números de abajo son medidos, no marketing. WER, velocidad y precio se muestran tal cual, brutalmente honestos.
258/265 muestras transcritas · 100% de éxito
Menor es mejor · en 265 muestras
Precio
Precio de lista de VibeVoice ASR para transcripción por lotes. Sin descuentos ni tarifas negociadas: la tarifa bruta por minuto.
Fuente del precio: precios públicos de VibeVoice ASR. Duudlaga Flow se muestra solo como contexto; esta página aísla VibeVoice ASR para que el número no esté inflado por nuestro producto.
WER y CER por conjunto de datos
Tasas de error de palabras y caracteres por conjunto de datos. Menor es mejor — y estos son los números reales de VibeVoice ASR, que son débiles en Common Voice 24.
Resumen por conjunto de datos
Precisión, velocidad y tiempos agregados de cada conjunto de datos.
| Conjunto de datos | Origen | Muestras | Éxito | WER | CER | Precisión | Velocidad | Audio (s) | Proc. (s) |
|---|---|---|---|---|---|---|---|---|---|
| Common Voice 24 (MN) | Hugging Face → | 59 | 57/59 | 98.9% | 59.2% | 1.1% | 0.56× | 318.8s | 574.1s |
| Shunya Labs Mongolian Speech | Hugging Face → | 60 | 59/60 | 114.2% | 58% | -14.2% | 0.63× | 630.9s | 1003.2s |
| Common Voice 20 (MN) | Hugging Face → | 54 | 52/54 | 103.8% | 62.2% | -3.8% | 0.57× | 258.2s | 452.9s |
| Modern Voice | — | 92 | 90/92 | 109.4% | 63.4% | -9.4% | 0.43× | 580.6s | 1338.1s |
WER frente a velocidad — por muestra
Cada punto es una muestra de audio. El punto ideal es abajo a la izquierda (poco error, rápido). VibeVoice ASR tiene un error alto en muchas muestras de Common Voice 24.
Resultados por muestra
La verdad fundamental se muestra tal cual en la columna Esperado. La columna de resultado resalta en rojo solo las palabras que VibeVoice ASR erró — sin tachados ni reemplazos, solo los errores.
| # | Audio | Muestra | Conjunto de datos | Esperado (verdad fundamental) | Resultado de VibeVoice ASR | WER | CER | I/D/S |
|---|---|---|---|---|---|---|---|---|
| 1 | btsee_0001 | Common Voice 24 (MN) | Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье. | Китэйм солонгос рахасаа, мөн тэнд мэдэгдэхгүй байна шүү дээ. | 112.5% | 63.8% | 1/0/8 | |
| 2 | btsee_0002 | Common Voice 24 (MN) | Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү? | Надад зээс санагч ралхитэг юрдогорхон сарын хутагдай байсан гэж байна. | 66.7% | 42.7% | 0/2/6 | |
| 3 | btsee_0003 | Common Voice 24 (MN) | Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе. | Атаа титурстуучин бийгээс ард хичээсгээд. | 100.0% | 55.8% | 0/2/5 | |
| 4 | btsee_0004 | Common Voice 24 (MN) | Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн. | Би бас алтуу хэдэр гэр, эцэрг дэргий чи аптахуун. | 80.0% | 43.1% | 0/1/7 | |
| 5 | btsee_0005 | Common Voice 24 (MN) | Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ. | Ханхан мэдээлэл, бүртгэл баруунд нэг хэсэг, зөөвөр нэг рус шүршгээ. | 100.0% | 72.7% | 0/0/10 | |
| 6 | btsee_0006 | Common Voice 24 (MN) | Алив наашаа ороод ир гээд гэртээ оров. | Аз жүн байш, ороудыр, гейт кэсэдэ ороудыр. | 100.0% | 62.2% | 0/0/7 | |
| 7 | btsee_0007 | Common Voice 24 (MN) | Өө өндөр дээдэс таны тухайд би баталж чадахгүй. | О, өндөртөөс танигдаж байгаа бие баталгаатай байна шүү дээ. | 112.5% | 76.1% | 1/0/8 | |
| 8 | btsee_0008 | Common Voice 24 (MN) | Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв. | Харин, урвдаг, удахас, яглэг, хүмүүсийг санжуулж лүү. | 75.0% | 35.7% | 0/1/5 | |
| 9 | btsee_0009 | Common Voice 24 (MN) | Та нар очингуутаа шөл л өгч үз. | Танар, очонгутаа, шүлэл, юг, чүүдз. | 100.0% | 30.0% | 0/2/5 | |
| 10 | btsee_0010 | Common Voice 24 (MN) | Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь. | Ирсээд үүрдүүр сэсэлтэй өгөөд сэгчихээд. | 100.0% | 72.9% | 0/2/5 |
Metodología
Cómo se obtuvieron estos números.
Proveedor: VibeVoice ASR (Microsoft VibeVoice-ASR (7.6B, MIT) run locally — a long-form speech LLM covering 50+ languages. Needs a Mongolian context prompt: without it, language auto-detection picks the wrong script entirely.).
Endpoint local (transformers). Idioma mn. Punto operativo microsoft/VibeVoice-ASR-HF (Mongolian context prompt, transcription_only) on mps. Diarización none.
Conjuntos de datos: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 muestras, 1788.5s de audio en total.
- Common Voice 24 (MN)https://huggingface.co/datasets/btsee/common-voices-24-mn
- Shunya Labs Mongolian Speechhttps://huggingface.co/datasets/shunyalabs/mongolian-speech-dataset
- Common Voice 20 (MN)https://huggingface.co/datasets/warmestman/common-voice-20-mn-normalized
- Modern Voice—
Métricas: WER y CER se calculan con una alineación Levenshtein de palabras/caracteres estándar, normalizada por mayúsculas y puntuación. Precisión = 100 − WER. Factor de velocidad = duración de audio ÷ tiempo de procesamiento (× tiempo real). Todas las solicitudes son llamadas reales a la Batch API de VibeVoice ASR, no en caché ni simuladas.
Resaltado de diferencias: La columna de resultado se alinea con la verdad fundamental y colorea en rojo cada sustitución e inserción. Las eliminaciones (palabras que faltan en el resultado) no se muestran en la columna de resultado — la columna Esperado ya contiene toda la verdad fundamental tal cual.