Ranking rozpoznawania mowy w języku mongolskim
Qwen3-ASR-FlashPunkt pracy: qwen3-asr-flash

Qwen3-ASR-Flash — Benchmark rozpoznawania mowy w języku mongolskim

Rzeczywiste wyniki Qwen3-ASR-Flash Batch API (udoskonalony punkt operacyjny, język auto (mn rejected)) ocenione na 4 mongolskich zbiorach danych i 265 próbkach audio. Każda liczba poniżej jest zmierzona, a nie z marketingu. WER, prędkość i cena są pokazane tak, jak są, brutalnie szczerze.

Język:AUTO (MN REJECTED)Diaryzacja:nonePróbki:265Uruchomienie:Aug 24, 2026, 3:13 PMEndpoint:https://dashscope-intl.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation
067100-3.7%
Dokładność

265/265 próbek transkrybowanych · 100% sukcesu

067100103.7%
Wskaźnik błędów słownych

Niższy jest lepszy · na 265 próbkach

Główne metryki
Wskaźnik błędów znakowych86.4%
Średni współczynnik prędkości2.19×krotność czasu rzeczywistego
Całkowity współczynnik prędkości2.19×
Średnie opóźnienie na próbkę3.2s
Łącznie przetworzony dźwięk1849.3s30.8 min

Cena

Cena katalogowa Qwen3-ASR-Flash dla transkrypcji wsadowej. Bez rabatów i negocjowanych stawek — surowa stawka za minutę.

Za 1000 minut
$2.1
wsad
Za minutę
$0.0021
efektywnie
Za 1000 min (te 30.8 min)
$3.88
wyniesie
Otwarte źródło?
własnościowy

Źródło ceny: publiczne ceny Qwen3-ASR-Flash. Duudlaga Flow jest pokazany tylko kontekstowo — ta strona izoluje Qwen3-ASR-Flash, aby liczba nie była zawyżana przez nasz produkt.

WER i CER według zbioru danych

Wskaźniki błędów słownych i znakowych według zbioru danych. Niższy jest lepszy — a to są rzeczywiste liczby Qwen3-ASR-Flash, które są słabe na Common Voice 24.

Common Voice 24 (MN)
Źródłowy zbiór danych →
WER
105.2%
CER
90%
Shunya Labs Mongolian Speech
Źródłowy zbiór danych →
WER
102.3%
CER
75.2%
Common Voice 20 (MN)
Źródłowy zbiór danych →
WER
104.5%
CER
90.4%
Modern Voice
WER
103.2%
CER
89.1%
WERCER

Podsumowanie według zbioru danych

Agregowana dokładność, prędkość i czasy dla każdego zbioru danych.

Zbiór danychŹródłoPróbkiSukcesWERCERDokładnośćPrędkośćAudio (s)Przetw. (s)
Common Voice 24 (MN)Hugging Face →5959/59105.2%90%-5.2%2.81×330.6s117.7s
Shunya Labs Mongolian SpeechHugging Face →6060/60102.3%75.2%-2.3%1.94×645.1s332.9s
Common Voice 20 (MN)Hugging Face →5454/54104.5%90.4%-4.5%2.71×269.8s99.5s
Modern Voice9292/92103.2%89.1%-3.2%2.04×603.8s295.3s

WER a prędkość — na próbkę

Każdy punkt to jedna próbka audio. Optymalne miejsce to lewy dolny róg (mało błędów, szybko). Qwen3-ASR-Flash ma wysoki poziom błędów na wielu próbkach Common Voice 24.

Wyniki na próbkę

Prawda odniesienia jest pokazana dosłownie w kolumnie Oczekiwane. Kolumna wyniku wyróżnia na czerwono tylko słowa, które Qwen3-ASR-Flash rozpoznał błędnie — bez przekreśleń i zamian, tylko błędy.

265 wierszy
czerwonybłędne słowo w wynikuzwykłypoprawnie transkrybowaneKolumna Oczekiwane jest pokazana dosłownie jako prawda odniesienia
#DźwiękPróbkaZbiór danychOczekiwane (prawda odniesienia)Wynik Qwen3-ASR-FlashWERCERI/D/S
1btsee_0001Common Voice 24 (MN)Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье.كشدا مسخرة خاصة ومن تندم يدي جاغا هي لي.112.5%87.9%1/0/8
2btsee_0002Common Voice 24 (MN)Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү?나타자야상아처럼깨끗이剃도그러곤살에혹자떼버리는게좋.100.0%100.0%0/11/1
3btsee_0003Common Voice 24 (MN)Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе.أعطى بيدروس دوتشين فيكيسي سفيرًا لتشيكيا.100.0%92.3%0/1/6
4btsee_0004Common Voice 24 (MN)Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн.Við varst kalt og hér er gott, ég þyrfti þér ekki segja það kom.150.0%111.8%5/0/10
5btsee_0005Common Voice 24 (MN)Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ.خانفرم استورت سپورت کویبرا ونیو خیرت ثووگارنیرو شریمچی.100.0%92.2%0/2/8
6btsee_0006Common Voice 24 (MN)Алив наашаа ороод ир гээд гэртээ оров.عجبنه شعرة كتكشت تعرف.100.0%91.9%0/3/4
7btsee_0007Common Voice 24 (MN)Өө өндөр дээдэс таны тухайд би баталж чадахгүй.أو أنظر تلك التنيطات ببطء شتى.100.0%89.1%0/2/6
8btsee_0008Common Voice 24 (MN)Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.Herhangi rüptükle takas etmek umutsuzca zor çıktı.100.0%92.9%0/1/7
9btsee_0009Common Voice 24 (MN)Та нар очингуутаа шөл л өгч үз.Таны орчингод шүдлэл тохуч.100.0%60.0%0/3/4
10btsee_0010Common Voice 24 (MN)Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь.이로써 롤드컵에서 사타구니 없앤 첫.100.0%91.7%0/2/5
Strona 1 z 27

Metodologia

Jak uzyskano te liczby.

Dostawca: Qwen3-ASR-Flash (Alibaba qwen3-asr-flash hosted transcription with automatic language detection — Mongolian is not a supported language (the API rejects the 'mn' code).).

Endpoint https://dashscope-intl.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation. Język auto (mn rejected). Punkt pracy qwen3-asr-flash. Diaryzacja none.

Zbiory danych: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 próbek, łącznie 1849.3s audio.

Adresy źródłowe zbiorów danych:

Metryki: WER i CER są obliczane standardowym dopasowaniem Levenshteina słów/znaków, znormalizowanym pod kątem wielkości liter i interpunkcji. Dokładność = 100 − WER. Współczynnik prędkości = czas trwania audio ÷ czas przetwarzania (× czas rzeczywisty). Wszystkie żądania to rzeczywiste wywołania Batch API Qwen3-ASR-Flash, nie z pamięci podręcznej ani symulowane.

Podświetlanie różnic: Kolumna wyniku jest dopasowywana do prawdy odniesienia i koloruje na czerwono każdą substytucję i insercję. Delecje (słowa brakujące w wyniku) nie są pokazywane w kolumnie wyniku — kolumna Oczekiwane zawiera już pełną prawdę odniesienia taką, jaka jest.

Wygenerowane przez Qwen3-ASR-Flash Benchmark Runner · Qwen3-ASR-Flash Batch API v2 · uruchomienie Aug 24, 2026, 3:13 PM