wav2vec2 XLSR-53 MN — Benchmark rozpoznawania mowy w języku mongolskim
Rzeczywiste wyniki wav2vec2 XLSR-53 MN Batch API (udoskonalony punkt operacyjny, język mn) ocenione na 4 mongolskich zbiorach danych i 265 próbkach audio. Każda liczba poniżej jest zmierzona, a nie z marketingu. WER, prędkość i cena są pokazane tak, jak są, brutalnie szczerze.
265/265 próbek transkrybowanych · 100% sukcesu
Niższy jest lepszy · na 265 próbkach
Cena
Cena katalogowa wav2vec2 XLSR-53 MN dla transkrypcji wsadowej. Bez rabatów i negocjowanych stawek — surowa stawka za minutę.
Źródło ceny: publiczne ceny wav2vec2 XLSR-53 MN. Duudlaga Flow jest pokazany tylko kontekstowo — ta strona izoluje wav2vec2 XLSR-53 MN, aby liczba nie była zawyżana przez nasz produkt.
WER i CER według zbioru danych
Wskaźniki błędów słownych i znakowych według zbioru danych. Niższy jest lepszy — a to są rzeczywiste liczby wav2vec2 XLSR-53 MN, które są słabe na Common Voice 24.
Podsumowanie według zbioru danych
Agregowana dokładność, prędkość i czasy dla każdego zbioru danych.
| Zbiór danych | Źródło | Próbki | Sukces | WER | CER | Dokładność | Prędkość | Audio (s) | Przetw. (s) |
|---|---|---|---|---|---|---|---|---|---|
| Common Voice 24 (MN) | Hugging Face → | 59 | 59/59 | 37.2% | 11.4% | 62.8% | 37.32× | 330.6s | 8.9s |
| Shunya Labs Mongolian Speech | Hugging Face → | 60 | 60/60 | 44.6% | 15.3% | 55.4% | 45.18× | 645.1s | 14.3s |
| Common Voice 20 (MN) | Hugging Face → | 54 | 54/54 | 31.7% | 9.6% | 68.3% | 37.72× | 269.8s | 7.2s |
| Modern Voice | — | 92 | 92/92 | 58% | 24.3% | 42.0% | 45.1× | 603.8s | 13.4s |
WER a prędkość — na próbkę
Każdy punkt to jedna próbka audio. Optymalne miejsce to lewy dolny róg (mało błędów, szybko). wav2vec2 XLSR-53 MN ma wysoki poziom błędów na wielu próbkach Common Voice 24.
Wyniki na próbkę
Prawda odniesienia jest pokazana dosłownie w kolumnie Oczekiwane. Kolumna wyniku wyróżnia na czerwono tylko słowa, które wav2vec2 XLSR-53 MN rozpoznał błędnie — bez przekreśleń i zamian, tylko błędy.
| # | Dźwięk | Próbka | Zbiór danych | Oczekiwane (prawda odniesienia) | Wynik wav2vec2 XLSR-53 MN | WER | CER | I/D/S |
|---|---|---|---|---|---|---|---|---|
| 1 | btsee_0001 | Common Voice 24 (MN) | Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье. | гэхдээ амьсгал хураахаасаа өмнө танд мэдэж ягаагаа хэлэе | 25.0% | 6.9% | 0/0/2 | |
| 2 | btsee_0002 | Common Voice 24 (MN) | Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү? | надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж хүү | 8.3% | 1.3% | 0/0/1 | |
| 3 | btsee_0003 | Common Voice 24 (MN) | Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе. | одоо бид өөрждөө өвчин эмгийдээсээ салахыг хичээцгээ гийдэг | 57.1% | 21.2% | 1/0/3 | |
| 4 | btsee_0004 | Common Voice 24 (MN) | Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн. | би бол голдуу хээрээр гэр хэчээр дэр хийж явдаг хүн | 10.0% | 2.0% | 0/0/1 | |
| 5 | btsee_0005 | Common Voice 24 (MN) | Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ. | тав хурамжт уулаж болдоггүй бур вгүн хоёр луугаар нэргүүл хэрэгүлжээ | 90.0% | 29.9% | 0/0/9 | |
| 6 | btsee_0006 | Common Voice 24 (MN) | Алив наашаа ороод ир гээд гэртээ оров. | алив наашаа оройдр гээд гэртээ оров | 28.6% | 8.1% | 0/1/1 | |
| 7 | btsee_0007 | Common Voice 24 (MN) | Өө өндөр дээдэс таны тухайд би баталж чадахгүй. | өө өндөр дээд таны тухайд би баталж чадахгүй | 12.5% | 4.3% | 0/0/1 | |
| 8 | btsee_0008 | Common Voice 24 (MN) | Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв. | харин гурав даг удаагаас эхлэх хүмүүсийг сонирхож эхлэв | 25.0% | 5.4% | 0/0/2 | |
| 9 | btsee_0009 | Common Voice 24 (MN) | Та нар очингуутаа шөл л өгч үз. | та нар очингуутаа шүлэл өгч үз | 28.6% | 6.7% | 0/1/1 | |
| 10 | btsee_0010 | Common Voice 24 (MN) | Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь. | ерөөсөө л үйлдвэрээсээ салуугүй орсон юм чинь | 42.9% | 16.7% | 0/0/3 |
Metodologia
Jak uzyskano te liczby.
Dostawca: wav2vec2 XLSR-53 MN (wav2vec2 XLSR-53 fine-tuned on Mongolian Common Voice — by download count the most-used Mongolian-specific open ASR model on the Hub. CTC output, so no punctuation or casing.). Modele z tą odznaką trenowano na danych, które pokrywają się z korpusami benchmarku (mongolski Common Voice — 113 ze 173 próbek — lub publiczny korpus Shunya Labs). Wyniki na nakładających się korpusach są zawyżone przez zapamiętywanie; oceniaj te modele po tabeli z podziałem na zbiory danych na stronie szczegółów, zwłaszcza po korpusach, na których NIE były trenowane.
Endpoint local (transformers). Język mn. Punkt pracy anton-l/wav2vec2-large-xlsr-53-mongolian (CTC) on mps. Diaryzacja none.
Zbiory danych: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 próbek, łącznie 1849.3s audio.
- Common Voice 24 (MN)https://huggingface.co/datasets/btsee/common-voices-24-mn
- Shunya Labs Mongolian Speechhttps://huggingface.co/datasets/shunyalabs/mongolian-speech-dataset
- Common Voice 20 (MN)https://huggingface.co/datasets/warmestman/common-voice-20-mn-normalized
- Modern Voice—
Metryki: WER i CER są obliczane standardowym dopasowaniem Levenshteina słów/znaków, znormalizowanym pod kątem wielkości liter i interpunkcji. Dokładność = 100 − WER. Współczynnik prędkości = czas trwania audio ÷ czas przetwarzania (× czas rzeczywisty). Wszystkie żądania to rzeczywiste wywołania Batch API wav2vec2 XLSR-53 MN, nie z pamięci podręcznej ani symulowane.
Podświetlanie różnic: Kolumna wyniku jest dopasowywana do prawdy odniesienia i koloruje na czerwono każdą substytucję i insercję. Delecje (słowa brakujące w wyniku) nie są pokazywane w kolumnie wyniku — kolumna Oczekiwane zawiera już pełną prawdę odniesienia taką, jaka jest.