Mongoolse spraak-naar-tekst leaderboard
Azure SpeechWerkpunt: microsoft mn-MN (via Eden AI)

Azure Speech — Benchmark voor Mongoolse spraak-naar-tekst

Echte resultaten van de Azure Speech Batch API (verbeterd operationeel punt, taal mn), geëvalueerd op 4 Mongoolse datasets en 265 audiosamples. Elk getal hieronder is gemeten — geen marketing. WER, snelheid en prijs worden getoond zoals ze zijn, brutaal eerlijk.

Taal:MNDiarisatie:noneMonsters:265Uitvoering:Aug 15, 2026, 5:41 AMEndpoint:https://api.edenai.run/v2/audio/speech_to_text_async
06710079.2%
Nauwkeurigheid

264/265 samples getranscribeerd · 100% succes

06710020.8%
Woordfoutpercentage

Lager is beter · over 265 samples

Kernmetrics
Tekenfoutpercentage9.7%
Gem. snelheidsfactor0.39×realtime veelvoud
Totale snelheidsfactor0.39×
Gem. latentie per sample17.3s
Totaal verwerkte audio1844.3s30.7 min

Prijs

Azure Speech-lijstprijs voor batch-transcriptie. Geen kortingen of onderhandelde tarieven — het ruwe tarief per minuut.

Per 1000 minuten
$16.7
batch
Per minuut
$0.0167
effectief
Per 1000 min (deze 30.7 min)
$30.80
zou kosten
Open source?
propriëtair

Prijsbron: publieke prijzen van Azure Speech. Duudlaga Flow wordt alleen ter context getoond — deze pagina isoleert Azure Speech zodat het getal niet wordt opgeblazen door ons eigen product.

WER en CER per dataset

Woord- en tekenfoutpercentages per dataset. Lager is beter — en dit zijn de echte Azure Speech-cijfers, die zwak zijn op Common Voice 24.

Common Voice 24 (MN)
Brondataset →
WER
14.9%
CER
5.6%
Shunya Labs Mongolian Speech
Brondataset →
WER
18.4%
CER
8.4%
Common Voice 20 (MN)
Brondataset →
WER
12.7%
CER
4.9%
Modern Voice
WER
30.9%
CER
16.1%
WERCER

Overzicht per dataset

Geaggregeerde nauwkeurigheid, snelheid en timing per dataset.

DatasetBronMonstersSuccesWERCERNauwkeurigheidSnelheidAudio (s)Verw. (s)
Common Voice 24 (MN)Hugging Face →5959/5914.9%5.6%85.1%0.28×330.6s1175.5s
Shunya Labs Mongolian SpeechHugging Face →6060/6018.4%8.4%81.6%0.57×645.1s1141.3s
Common Voice 20 (MN)Hugging Face →5454/5412.7%4.9%87.3%0.39×269.8s683.3s
Modern Voice9291/9230.9%16.1%69.1%0.34×598.8s1780.6s

WER vs. snelheid — per sample

Elke stip is één audiosample. De sweet spot is linksonder (weinig fouten, snel). Azure Speech scoort hoog op fouten bij veel Common Voice 24-samples.

Resultaten per sample

De ground truth wordt ongewijzigd getoond in de kolom Verwacht. De resultaatkolom markeert alleen de woorden die Azure Speech fout had in rood — geen doorhalingen of wissels, alleen de fouten.

265 rijen
roodfout woord in het resultaatnormaalcorrect getranscribeerdDe kolom Verwacht wordt ongewijzigd als ground truth getoond
#AudioMonsterDatasetVerwacht (ground truth)Azure Speech-resultaatWERCERI/D/S
1btsee_0001Common Voice 24 (MN)Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье.Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье.0.0%0.0%0/0/0
2btsee_0002Common Voice 24 (MN)Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү?Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү?0.0%0.0%0/0/0
3btsee_0003Common Voice 24 (MN)Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе.Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе.0.0%0.0%0/0/0
4btsee_0004Common Voice 24 (MN)Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн.Би бол голдуу хээрээр Гэр хичээл дээр хийж явдаг Хүн.20.0%7.8%0/0/2
5btsee_0005Common Voice 24 (MN)Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ.Хан хурмаст уурлаж болдоггүй бор өвгөнийг 2 луугаараа эргүүлэхээр явж.30.0%13.0%0/0/3
6btsee_0006Common Voice 24 (MN)Алив наашаа ороод ир гээд гэртээ оров.Алив наашаа ороод ир гээд гэртээ оров.0.0%0.0%0/0/0
7btsee_0007Common Voice 24 (MN)Өө өндөр дээдэс таны тухайд би баталж чадахгүй.Өө өндөр дээдэс таны тухайд Би баталж чадахгүй.0.0%0.0%0/0/0
8btsee_0008Common Voice 24 (MN)Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.Хорин 3 дахь удаагаас. Эхлэн хүмүүсийг сонирхож эхлэв.25.0%10.7%0/0/2
9btsee_0009Common Voice 24 (MN)Та нар очингуутаа шөл л өгч үз.Та нар очингуутаа шүлэг л өгч үз.14.3%10.0%0/0/1
10btsee_0010Common Voice 24 (MN)Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь.Ерөөсөө л үйлдвэрээсээ салаагүй явсан юм чинь.14.3%6.2%0/0/1
Pagina 1 van 27

Methodologie

Hoe deze getallen zijn verkregen.

Leverancier: Azure Speech (Microsoft Azure AI Speech batch transcription (mn-MN), accessed through the Eden AI gateway.).

Endpoint https://api.edenai.run/v2/audio/speech_to_text_async. Taal mn. Werkpunt microsoft mn-MN (via Eden AI). Diarisatie none.

Datasets: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 samples, in totaal 1844.3s audio.

Bron-URL's van datasets:

Metrieken: WER en CER worden berekend met een standaard woord-/teken-Levenshtein-uitlijning, genormaliseerd voor hoofdletters en leestekens. Nauwkeurigheid = 100 − WER. Snelheidsfactor = audioduur ÷ verwerkingstijd (× realtime). Alle verzoeken zijn echte Azure Speech-Batch-API-aanroepen, niet gecached of gesimuleerd.

Verschilmarkering: De resultaatkolom wordt uitgelijnd op de ground truth en kleurt elke substitutie en insertie rood. Deleties (woorden die ontbreken in het resultaat) worden niet in de resultaatkolom getoond — de kolom Verwacht bevat al de volledige ground truth ongewijzigd.

Gegenereerd door Azure Speech Benchmark Runner · Azure Speech Batch API v2 · uitvoering Aug 15, 2026, 5:41 AM