VibeVoice ASR — Benchmark rozpoznawania mowy w języku mongolskim
Rzeczywiste wyniki VibeVoice ASR Batch API (udoskonalony punkt operacyjny, język mn) ocenione na 4 mongolskich zbiorach danych i 265 próbkach audio. Każda liczba poniżej jest zmierzona, a nie z marketingu. WER, prędkość i cena są pokazane tak, jak są, brutalnie szczerze.
258/265 próbek transkrybowanych · 100% sukcesu
Niższy jest lepszy · na 265 próbkach
Cena
Cena katalogowa VibeVoice ASR dla transkrypcji wsadowej. Bez rabatów i negocjowanych stawek — surowa stawka za minutę.
Źródło ceny: publiczne ceny VibeVoice ASR. Duudlaga Flow jest pokazany tylko kontekstowo — ta strona izoluje VibeVoice ASR, aby liczba nie była zawyżana przez nasz produkt.
WER i CER według zbioru danych
Wskaźniki błędów słownych i znakowych według zbioru danych. Niższy jest lepszy — a to są rzeczywiste liczby VibeVoice ASR, które są słabe na Common Voice 24.
Podsumowanie według zbioru danych
Agregowana dokładność, prędkość i czasy dla każdego zbioru danych.
| Zbiór danych | Źródło | Próbki | Sukces | WER | CER | Dokładność | Prędkość | Audio (s) | Przetw. (s) |
|---|---|---|---|---|---|---|---|---|---|
| Common Voice 24 (MN) | Hugging Face → | 59 | 57/59 | 98.9% | 59.2% | 1.1% | 0.56× | 318.8s | 574.1s |
| Shunya Labs Mongolian Speech | Hugging Face → | 60 | 59/60 | 114.2% | 58% | -14.2% | 0.63× | 630.9s | 1003.2s |
| Common Voice 20 (MN) | Hugging Face → | 54 | 52/54 | 103.8% | 62.2% | -3.8% | 0.57× | 258.2s | 452.9s |
| Modern Voice | — | 92 | 90/92 | 109.4% | 63.4% | -9.4% | 0.43× | 580.6s | 1338.1s |
WER a prędkość — na próbkę
Każdy punkt to jedna próbka audio. Optymalne miejsce to lewy dolny róg (mało błędów, szybko). VibeVoice ASR ma wysoki poziom błędów na wielu próbkach Common Voice 24.
Wyniki na próbkę
Prawda odniesienia jest pokazana dosłownie w kolumnie Oczekiwane. Kolumna wyniku wyróżnia na czerwono tylko słowa, które VibeVoice ASR rozpoznał błędnie — bez przekreśleń i zamian, tylko błędy.
| # | Dźwięk | Próbka | Zbiór danych | Oczekiwane (prawda odniesienia) | Wynik VibeVoice ASR | WER | CER | I/D/S |
|---|---|---|---|---|---|---|---|---|
| 1 | btsee_0001 | Common Voice 24 (MN) | Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье. | Китэйм солонгос рахасаа, мөн тэнд мэдэгдэхгүй байна шүү дээ. | 112.5% | 63.8% | 1/0/8 | |
| 2 | btsee_0002 | Common Voice 24 (MN) | Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү? | Надад зээс санагч ралхитэг юрдогорхон сарын хутагдай байсан гэж байна. | 66.7% | 42.7% | 0/2/6 | |
| 3 | btsee_0003 | Common Voice 24 (MN) | Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе. | Атаа титурстуучин бийгээс ард хичээсгээд. | 100.0% | 55.8% | 0/2/5 | |
| 4 | btsee_0004 | Common Voice 24 (MN) | Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн. | Би бас алтуу хэдэр гэр, эцэрг дэргий чи аптахуун. | 80.0% | 43.1% | 0/1/7 | |
| 5 | btsee_0005 | Common Voice 24 (MN) | Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ. | Ханхан мэдээлэл, бүртгэл баруунд нэг хэсэг, зөөвөр нэг рус шүршгээ. | 100.0% | 72.7% | 0/0/10 | |
| 6 | btsee_0006 | Common Voice 24 (MN) | Алив наашаа ороод ир гээд гэртээ оров. | Аз жүн байш, ороудыр, гейт кэсэдэ ороудыр. | 100.0% | 62.2% | 0/0/7 | |
| 7 | btsee_0007 | Common Voice 24 (MN) | Өө өндөр дээдэс таны тухайд би баталж чадахгүй. | О, өндөртөөс танигдаж байгаа бие баталгаатай байна шүү дээ. | 112.5% | 76.1% | 1/0/8 | |
| 8 | btsee_0008 | Common Voice 24 (MN) | Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв. | Харин, урвдаг, удахас, яглэг, хүмүүсийг санжуулж лүү. | 75.0% | 35.7% | 0/1/5 | |
| 9 | btsee_0009 | Common Voice 24 (MN) | Та нар очингуутаа шөл л өгч үз. | Танар, очонгутаа, шүлэл, юг, чүүдз. | 100.0% | 30.0% | 0/2/5 | |
| 10 | btsee_0010 | Common Voice 24 (MN) | Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь. | Ирсээд үүрдүүр сэсэлтэй өгөөд сэгчихээд. | 100.0% | 72.9% | 0/2/5 |
Metodologia
Jak uzyskano te liczby.
Dostawca: VibeVoice ASR (Microsoft VibeVoice-ASR (7.6B, MIT) run locally — a long-form speech LLM covering 50+ languages. Needs a Mongolian context prompt: without it, language auto-detection picks the wrong script entirely.).
Endpoint local (transformers). Język mn. Punkt pracy microsoft/VibeVoice-ASR-HF (Mongolian context prompt, transcription_only) on mps. Diaryzacja none.
Zbiory danych: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 próbek, łącznie 1788.5s audio.
- Common Voice 24 (MN)https://huggingface.co/datasets/btsee/common-voices-24-mn
- Shunya Labs Mongolian Speechhttps://huggingface.co/datasets/shunyalabs/mongolian-speech-dataset
- Common Voice 20 (MN)https://huggingface.co/datasets/warmestman/common-voice-20-mn-normalized
- Modern Voice—
Metryki: WER i CER są obliczane standardowym dopasowaniem Levenshteina słów/znaków, znormalizowanym pod kątem wielkości liter i interpunkcji. Dokładność = 100 − WER. Współczynnik prędkości = czas trwania audio ÷ czas przetwarzania (× czas rzeczywisty). Wszystkie żądania to rzeczywiste wywołania Batch API VibeVoice ASR, nie z pamięci podręcznej ani symulowane.
Podświetlanie różnic: Kolumna wyniku jest dopasowywana do prawdy odniesienia i koloruje na czerwono każdą substytucję i insercję. Delecje (słowa brakujące w wyniku) nie są pokazywane w kolumnie wyniku — kolumna Oczekiwane zawiera już pełną prawdę odniesienia taką, jaka jest.