Ranking rozpoznawania mowy w języku mongolskim
SeamlessM4T v2Punkt pracy: facebook/seamless-m4t-v2-large (tgt_lang=khk) on mps

SeamlessM4T v2 — Benchmark rozpoznawania mowy w języku mongolskim

Rzeczywiste wyniki SeamlessM4T v2 Batch API (udoskonalony punkt operacyjny, język mn) ocenione na 4 mongolskich zbiorach danych i 265 próbkach audio. Każda liczba poniżej jest zmierzona, a nie z marketingu. WER, prędkość i cena są pokazane tak, jak są, brutalnie szczerze.

Język:MNDiaryzacja:nonePróbki:265Uruchomienie:Aug 18, 2026, 10:12 AMEndpoint:local (transformers)
06710076%
Dokładność

265/265 próbek transkrybowanych · 100% sukcesu

06710024%
Wskaźnik błędów słownych

Niższy jest lepszy · na 265 próbkach

Główne metryki
Wskaźnik błędów znakowych11.1%
Średni współczynnik prędkości0.39×krotność czasu rzeczywistego
Całkowity współczynnik prędkości0.39×
Średnie opóźnienie na próbkę26.3s
Łącznie przetworzony dźwięk1849.3s30.8 min

Cena

Cena katalogowa SeamlessM4T v2 dla transkrypcji wsadowej. Bez rabatów i negocjowanych stawek — surowa stawka za minutę.

Za 1000 minut
$0
wsad
Za minutę
$0.0000
efektywnie
Za 1000 min (te 30.8 min)
$0.00
wyniesie
Otwarte źródło?
własnościowy

Źródło ceny: publiczne ceny SeamlessM4T v2. Duudlaga Flow jest pokazany tylko kontekstowo — ta strona izoluje SeamlessM4T v2, aby liczba nie była zawyżana przez nasz produkt.

WER i CER według zbioru danych

Wskaźniki błędów słownych i znakowych według zbioru danych. Niższy jest lepszy — a to są rzeczywiste liczby SeamlessM4T v2, które są słabe na Common Voice 24.

Common Voice 24 (MN)
Źródłowy zbiór danych →
WER
17.6%
CER
6.3%
Shunya Labs Mongolian Speech
Źródłowy zbiór danych →
WER
22.2%
CER
10.2%
Common Voice 20 (MN)
Źródłowy zbiór danych →
WER
21.7%
CER
7.9%
Modern Voice
WER
30.9%
CER
16.7%
WERCER

Podsumowanie według zbioru danych

Agregowana dokładność, prędkość i czasy dla każdego zbioru danych.

Zbiór danychŹródłoPróbkiSukcesWERCERDokładnośćPrędkośćAudio (s)Przetw. (s)
Common Voice 24 (MN)Hugging Face →5959/5917.6%6.3%82.4%3.59×330.6s92.1s
Shunya Labs Mongolian SpeechHugging Face →6060/6022.2%10.2%77.8%0.25×645.1s2569.2s
Common Voice 20 (MN)Hugging Face →5454/5421.7%7.9%78.3%0.14×269.8s1897s
Modern Voice9292/9230.9%16.7%69.1%4.26×603.8s141.6s

WER a prędkość — na próbkę

Każdy punkt to jedna próbka audio. Optymalne miejsce to lewy dolny róg (mało błędów, szybko). SeamlessM4T v2 ma wysoki poziom błędów na wielu próbkach Common Voice 24.

Wyniki na próbkę

Prawda odniesienia jest pokazana dosłownie w kolumnie Oczekiwane. Kolumna wyniku wyróżnia na czerwono tylko słowa, które SeamlessM4T v2 rozpoznał błędnie — bez przekreśleń i zamian, tylko błędy.

265 wierszy
czerwonybłędne słowo w wynikuzwykłypoprawnie transkrybowaneKolumna Oczekiwane jest pokazana dosłownie jako prawda odniesienia
#DźwiękPróbkaZbiór danychOczekiwane (prawda odniesienia)Wynik SeamlessM4T v2WERCERI/D/S
1btsee_0001Common Voice 24 (MN)Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье.Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье.0.0%0.0%0/0/0
2btsee_0002Common Voice 24 (MN)Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү?Надад аясан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү?8.3%2.7%0/0/1
3btsee_0003Common Voice 24 (MN)Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе.Одоо бид өөрсдөө өвчнөөр эмгэгээсээ салахыг хичээцгээе.14.3%7.7%0/0/1
4btsee_0004Common Voice 24 (MN)Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн.Би бол голдуу хээрээр гэр, хетээр дэр хийж явдаг хүн.10.0%3.9%0/0/1
5btsee_0005Common Voice 24 (MN)Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ.Хан хурамс уурлаж, болдоггүй бор уг нь хоёр луугаар нэхүүлэхээр явуулжээ.60.0%19.5%1/0/5
6btsee_0006Common Voice 24 (MN)Алив наашаа ороод ир гээд гэртээ оров.Алив наашаа ороод ир гээд гэртээ оров.0.0%0.0%0/0/0
7btsee_0007Common Voice 24 (MN)Өө өндөр дээдэс таны тухайд би баталж чадахгүй.Өө, өндөр дээдэс таны тухайд би батлаж чадахгүй.12.5%4.3%0/0/1
8btsee_0008Common Voice 24 (MN)Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.харин гурав дахь удаагаа эхлээд хүмүүсийг сонирхож эхлэв.25.0%5.4%0/0/2
9btsee_0009Common Voice 24 (MN)Та нар очингуутаа шөл л өгч үз.Та нар очингуутаа шөл л өгч үз.0.0%0.0%0/0/0
10btsee_0010Common Voice 24 (MN)Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь.Ерөөсөө л үйлдвэрээсээ салаагүй явсан юм чинь.14.3%6.2%0/0/1
Strona 1 z 27

Metodologia

Jak uzyskano te liczby.

Dostawca: SeamlessM4T v2 (Meta SeamlessM4T v2 Large speech-to-text run locally, decoding to Halh Mongolian (khk) — 2.3B params covering ~100 source languages.).

Endpoint local (transformers). Język mn. Punkt pracy facebook/seamless-m4t-v2-large (tgt_lang=khk) on mps. Diaryzacja none.

Zbiory danych: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 próbek, łącznie 1849.3s audio.

Adresy źródłowe zbiorów danych:

Metryki: WER i CER są obliczane standardowym dopasowaniem Levenshteina słów/znaków, znormalizowanym pod kątem wielkości liter i interpunkcji. Dokładność = 100 − WER. Współczynnik prędkości = czas trwania audio ÷ czas przetwarzania (× czas rzeczywisty). Wszystkie żądania to rzeczywiste wywołania Batch API SeamlessM4T v2, nie z pamięci podręcznej ani symulowane.

Podświetlanie różnic: Kolumna wyniku jest dopasowywana do prawdy odniesienia i koloruje na czerwono każdą substytucję i insercję. Delecje (słowa brakujące w wyniku) nie są pokazywane w kolumnie wyniku — kolumna Oczekiwane zawiera już pełną prawdę odniesienia taką, jaka jest.

Wygenerowane przez SeamlessM4T v2 Benchmark Runner · SeamlessM4T v2 Batch API v2 · uruchomienie Aug 18, 2026, 10:12 AM