మంగోలియన్ స్పీచ్-టు-టెక్స్ట్ లీడర్‌బోర్డ్
Qwen3-ASR-FlashOperating point: qwen3-asr-flash

Qwen3-ASR-Flash — మంగోలియన్ స్పీచ్-టు-టెక్స్ట్ బెంచ్‌మార్క్

Qwen3-ASR-Flash Batch API (మెరుగైన ఆపరేటింగ్ పాయింట్, భాష auto (mn rejected)) ద్వారా 4 మంగోలియన్ డేటాసెట్‌లు మరియు 265 ఆడియో నమూనాలపై అంచనా వేసిన వాస్తవ ఫలితాలు. కింద ప్రతి సంఖ్య కొలిచినదే — మార్కెటింగ్ కాదు. WER, వేగం మరియు ధర అలాగే, కఠినమైన నిజాయితీతో చూపబడ్డాయి.

భాష:AUTO (MN REJECTED)స్పీకర్ వేరుచేత:noneనమూనాలు:265నడపు:Aug 24, 2026, 3:13 PMఎండ్‌పాయింట్:https://dashscope-intl.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation
067100-3.7%
ఖచ్చితత్వం

265/265 నమూనాలు ట్రాన్స్‌క్రైబ్ అయ్యాయి · 100% విజయం

067100103.7%
పద పొరపాటు రేటు

తక్కువ మంచిది · 265 నమూనాలపై

ముఖ్య మెట్రిక్స్
అక్షర పొరపాటు రేటు86.4%
సగటు వేగ గుణకం2.19×రియల్-టైమ్ గుణకారం
మొత్తం వేగ గుణకం2.19×
నమూనాకు సగటు ఆలస్యం3.2s
మొత్తం ప్రాసెస్ చేసిన ఆడియో1849.3s30.8 నిమి

ధర

బ్యాచ్ ట్రాన్స్‌క్రిప్షన్ కోసం Qwen3-ASR-Flash జాబితా ధర. లాభాలు లేవు లేదా చర్చించిన రేట్లు లేవు — నిమిషానికి ముడి రేటు.

1000 నిమిషాలకు
$2.1
బ్యాచ్
నిమిషానికి
$0.0021
సమర్థవంతం
1000 నిమికి (ఈ 30.8 నిమి)
$3.88
ఖర్చు
ఓపెన్ సోర్స్?
యాజమాన్య

ధర మూలం: Qwen3-ASR-Flash పబ్లిక్ ధరలు. Duudlaga Flow కేవలం సందర్భం కోసం చూపబడింది — ఈ పేజీ Qwen3-ASR-Flash ను వేరు చేస్తుంది తద్వారా సంఖ్య మన ఉత్పత్తి ద్వారా పెంచబడదు.

డేటాసెట్ వారీ WER మరియు CER

డేటాసెట్ వారీ పద మరియు అక్షర పొరపాటు రేట్లు. తక్కువ మంచిది — మరియు ఇవి Qwen3-ASR-Flash యొక్క వాస్తవ సంఖ్యలు, అవి Common Voice 24 పై బలహీనంగా ఉన్నాయి.

Common Voice 24 (MN)
Source dataset →
WER
105.2%
CER
90%
Shunya Labs Mongolian Speech
Source dataset →
WER
102.3%
CER
75.2%
Common Voice 20 (MN)
Source dataset →
WER
104.5%
CER
90.4%
Modern Voice
WER
103.2%
CER
89.1%
WERCER

డేటాసెట్ సారాంశం

ప్రతి డేటాసెట్ కోసం సముదాయ ఖచ్చితత్వం, వేగం మరియు సమయం.

డేటాసెట్SourceనమూనాలువిజయంWERCERఖచ్చితత్వంవేగంఆడియో (సె)ప్రాసె. (సె)
Common Voice 24 (MN)Hugging Face →5959/59105.2%90%-5.2%2.81×330.6s117.7s
Shunya Labs Mongolian SpeechHugging Face →6060/60102.3%75.2%-2.3%1.94×645.1s332.9s
Common Voice 20 (MN)Hugging Face →5454/54104.5%90.4%-4.5%2.71×269.8s99.5s
Modern Voice9292/92103.2%89.1%-3.2%2.04×603.8s295.3s

WER vs వేగం — నమూనా వారీ

ప్రతి బిందువు ఒక ఆడియో నమూనా. సరైన స్థానం కింద-ఎడమ (తక్కువ పొరపాటు, వేగం). Qwen3-ASR-Flash అనేక Common Voice 24 నమూనాలపై అధిక పొరపాటు కలిగి ఉంది.

నమూనా వారీ ఫలితాలు

అనుకున్న కాలమ్‌లో గ్రౌండ్ ట్రూత్ అలాగే చూపబడింది. ఫలితాల కాలమ్ Qwen3-ASR-Flash తప్పు చేసిన పదాలను మాత్రమే ఎరుపు రంగులో హైలైట్ చేస్తుంది — స్ట్రైక్‌థ్రూ/మార్పిడి లేదు, కేవలం తప్పులు.

265 వరుసలు
ఎరుపుఫలితంలో తప్పు పదంసాధారణసరైన ట్రాన్స్‌క్రైబ్అనుకున్న కాలమ్ గ్రౌండ్ ట్రూత్‌గా అలాగే చూపబడింది
#ఆడియోనమూనాడేటాసెట్అనుకున్న (గ్రౌండ్ ట్రూత్)Qwen3-ASR-Flash ఫలితంWERCERI/D/S
1btsee_0001Common Voice 24 (MN)Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье.كشدا مسخرة خاصة ومن تندم يدي جاغا هي لي.112.5%87.9%1/0/8
2btsee_0002Common Voice 24 (MN)Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү?나타자야상아처럼깨끗이剃도그러곤살에혹자떼버리는게좋.100.0%100.0%0/11/1
3btsee_0003Common Voice 24 (MN)Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе.أعطى بيدروس دوتشين فيكيسي سفيرًا لتشيكيا.100.0%92.3%0/1/6
4btsee_0004Common Voice 24 (MN)Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн.Við varst kalt og hér er gott, ég þyrfti þér ekki segja það kom.150.0%111.8%5/0/10
5btsee_0005Common Voice 24 (MN)Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ.خانفرم استورت سپورت کویبرا ونیو خیرت ثووگارنیرو شریمچی.100.0%92.2%0/2/8
6btsee_0006Common Voice 24 (MN)Алив наашаа ороод ир гээд гэртээ оров.عجبنه شعرة كتكشت تعرف.100.0%91.9%0/3/4
7btsee_0007Common Voice 24 (MN)Өө өндөр дээдэс таны тухайд би баталж чадахгүй.أو أنظر تلك التنيطات ببطء شتى.100.0%89.1%0/2/6
8btsee_0008Common Voice 24 (MN)Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.Herhangi rüptükle takas etmek umutsuzca zor çıktı.100.0%92.9%0/1/7
9btsee_0009Common Voice 24 (MN)Та нар очингуутаа шөл л өгч үз.Таны орчингод шүдлэл тохуч.100.0%60.0%0/3/4
10btsee_0010Common Voice 24 (MN)Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь.이로써 롤드컵에서 사타구니 없앤 첫.100.0%91.7%0/2/5
పేజీ 1 / 27

పద్ధతిశాస్త్రం

ఈ సంఖ్యలు ఎలా వచ్చాయి.

ప్రొవైడర్: Qwen3-ASR-Flash (Alibaba qwen3-asr-flash hosted transcription with automatic language detection — Mongolian is not a supported language (the API rejects the 'mn' code).).

ఎండ్‌పాయింట్ https://dashscope-intl.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation. భాష auto (mn rejected). Operating point qwen3-asr-flash. స్పీకర్ వేరుచేత none.

డేటాసెట్‌లు: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 నమూనాలు, మొత్తం 1849.3s ఆడియో.

Dataset source URLs:

మెట్రిక్స్: WER మరియు CER ప్రామాణిక పద/అక్షర లెవెన్‌స్టైన్ అలైన్‌మెంట్‌తో, కేసు మరియు పంక్చుయేషన్‌కు నార్మలైజ్ చేసి లెక్కించబడతాయి. ఖచ్చితత్వం = 100 − WER. వేగ గుణకం = ఆడియో నిడివి ÷ ప్రాసెసింగ్ సమయం (× రియల్-టైమ్). అన్ని అభ్యర్థనలు నిజమైన Qwen3-ASR-Flash Batch API కాల్‌లు, క్యాషే లేదా సిమ్యులేటెడ్ కావు.

తేడా హైలైటింగ్: ఫలితాల కాలమ్ గ్రౌండ్ ట్రూత్‌తో అలైన్ అవుతుంది మరియు ప్రతి ప్రత్యామ్నాయం మరియు చొప్పింతను ఎరుపు రంగు చేస్తుంది. తొలగింపులు (ఫలితంలో లేని పదాలు) ఫలితాల కాలమ్‌లో చూపబడవు — అనుకున్న కాలమ్ ఇప్పటికే మొత్తం గ్రౌండ్ ట్రూత్‌ను అలాగే కలిగి ఉంది.

Qwen3-ASR-Flash Benchmark Runner ద్వారా రూపొందించబడింది · Qwen3-ASR-Flash Batch API v2 · నడిపినది Aug 24, 2026, 3:13 PM