VibeVoice ASR — Benchmark ng Mongolian speech-to-text
Tunay na resulta mula sa VibeVoice ASR Batch API (pinahusay na operating point, wika mn) na sinuri sa 4 Mongolian na dataset at 265 audio sample. Bawat numero sa ibaba ay sinusukat — hindi marketing. Ang WER, bilis, at presyo ay ipinapakita kung ano talaga, walang paligoy-ligoy na tapat.
258/265 sample na-transcribe · 100% tagumpay
Mas mababa mas mainam · sa 265 sample
Presyo
Presyo sa listahan ng VibeVoice ASR para sa batch transcription. Walang diskonto o negotiated na rate — ang hilaw na rate kada minuto.
Pinagmulan ng presyo: pampublikong presyo ng VibeVoice ASR. Ang Duudlaga Flow ay ipinapakita para sa konteksto lamang — inhihiwalay ng pahinang ito ang VibeVoice ASR para hindi palabasin ang numero ng aming produkto.
WER at CER bawat dataset
Tasa ng error sa salita at karakter bawat dataset. Mas mababa mas mainam — at ito ang tunay na numero ng VibeVoice ASR, na mahina sa Common Voice 24.
Buod ng dataset
Pinagsama-samang katumpakan, bilis, at timing para sa bawat dataset.
| Dataset | Source | Mga sample | Tagumpay | WER | CER | Katumpakan | Bilis | Audio (seg) | Proseso (seg) |
|---|---|---|---|---|---|---|---|---|---|
| Common Voice 24 (MN) | Hugging Face → | 59 | 57/59 | 98.9% | 59.2% | 1.1% | 0.56× | 318.8s | 574.1s |
| Shunya Labs Mongolian Speech | Hugging Face → | 60 | 59/60 | 114.2% | 58% | -14.2% | 0.63× | 630.9s | 1003.2s |
| Common Voice 20 (MN) | Hugging Face → | 54 | 52/54 | 103.8% | 62.2% | -3.8% | 0.57× | 258.2s | 452.9s |
| Modern Voice | — | 92 | 90/92 | 109.4% | 63.4% | -9.4% | 0.43× | 580.6s | 1338.1s |
WER laban sa bilis — kada sample
Bawat tuldok ay isang audio sample. Ang ideal na posisyon ay sa kaliwang baba (kaunting error, mabilis). Mataas ang error ng VibeVoice ASR sa maraming sample ng Common Voice 24.
Resulta kada sample
Ang ground truth ay ipinapakang walang pagbabago sa column na Inaasahan. Ang column ng resulta ay naghi-highlight ng pula sa mga salitang nagkamali ang VibeVoice ASR — walang pagstrike/cross-out, mga pagkakamali lamang.
| # | Audio | Sample | Dataset | Inaasahan (ground truth) | Resulta ng VibeVoice ASR | WER | CER | I/D/S |
|---|---|---|---|---|---|---|---|---|
| 1 | btsee_0001 | Common Voice 24 (MN) | Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье. | Китэйм солонгос рахасаа, мөн тэнд мэдэгдэхгүй байна шүү дээ. | 112.5% | 63.8% | 1/0/8 | |
| 2 | btsee_0002 | Common Voice 24 (MN) | Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү? | Надад зээс санагч ралхитэг юрдогорхон сарын хутагдай байсан гэж байна. | 66.7% | 42.7% | 0/2/6 | |
| 3 | btsee_0003 | Common Voice 24 (MN) | Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе. | Атаа титурстуучин бийгээс ард хичээсгээд. | 100.0% | 55.8% | 0/2/5 | |
| 4 | btsee_0004 | Common Voice 24 (MN) | Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн. | Би бас алтуу хэдэр гэр, эцэрг дэргий чи аптахуун. | 80.0% | 43.1% | 0/1/7 | |
| 5 | btsee_0005 | Common Voice 24 (MN) | Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ. | Ханхан мэдээлэл, бүртгэл баруунд нэг хэсэг, зөөвөр нэг рус шүршгээ. | 100.0% | 72.7% | 0/0/10 | |
| 6 | btsee_0006 | Common Voice 24 (MN) | Алив наашаа ороод ир гээд гэртээ оров. | Аз жүн байш, ороудыр, гейт кэсэдэ ороудыр. | 100.0% | 62.2% | 0/0/7 | |
| 7 | btsee_0007 | Common Voice 24 (MN) | Өө өндөр дээдэс таны тухайд би баталж чадахгүй. | О, өндөртөөс танигдаж байгаа бие баталгаатай байна шүү дээ. | 112.5% | 76.1% | 1/0/8 | |
| 8 | btsee_0008 | Common Voice 24 (MN) | Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв. | Харин, урвдаг, удахас, яглэг, хүмүүсийг санжуулж лүү. | 75.0% | 35.7% | 0/1/5 | |
| 9 | btsee_0009 | Common Voice 24 (MN) | Та нар очингуутаа шөл л өгч үз. | Танар, очонгутаа, шүлэл, юг, чүүдз. | 100.0% | 30.0% | 0/2/5 | |
| 10 | btsee_0010 | Common Voice 24 (MN) | Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь. | Ирсээд үүрдүүр сэсэлтэй өгөөд сэгчихээд. | 100.0% | 72.9% | 0/2/5 |
Metodolohiya
Paano nakuha ang mga numerong ito.
Provider: VibeVoice ASR (Microsoft VibeVoice-ASR (7.6B, MIT) run locally — a long-form speech LLM covering 50+ languages. Needs a Mongolian context prompt: without it, language auto-detection picks the wrong script entirely.).
Endpoint local (transformers). Wika mn. Operating point microsoft/VibeVoice-ASR-HF (Mongolian context prompt, transcription_only) on mps. Diarisasyon none.
Mga dataset: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 sample, kabuuang 1788.5s audio.
- Common Voice 24 (MN)https://huggingface.co/datasets/btsee/common-voices-24-mn
- Shunya Labs Mongolian Speechhttps://huggingface.co/datasets/shunyalabs/mongolian-speech-dataset
- Common Voice 20 (MN)https://huggingface.co/datasets/warmestman/common-voice-20-mn-normalized
- Modern Voice—
Metrics: Ang WER at CER ay kinakwenta gamit ang standard na salita/karakter na Levenshtein alignment, na-normalize para sa case at punctuation. Katumpakan = 100 − WER. Factor ng bilis = duration ng audio ÷ processing time (× real-time). Lahat ng request ay tunay na tawag sa Batch API ng VibeVoice ASR, hindi cached o simulated.
Pag-highlight ng pagkakaiba: Ang column ng resulta ay ini-align sa ground truth at nagkokolor ng pula sa bawat substitution at insertion. Ang deletions (mga salitang nawawala sa resulta) ay hindi ipinapakita sa column ng resulta — ang column na Inaasahan ay may hawak na ng buong ground truth na walang pagbabago.