Mongoolse spraak-naar-tekst leaderboard
Google STTEndpoint: http://localhost:8080/transcribe

Google STT — Benchmark voor Mongoolse spraak-naar-tekst

Echte resultaten van de Google STT Batch API (verbeterd operationeel punt, taal mn-MN), geëvalueerd op 4 Mongoolse datasets en 265 audiosamples. Elk getal hieronder is gemeten — geen marketing. WER, snelheid en prijs worden getoond zoals ze zijn, brutaal eerlijk.

Taal:MN-MNMonsters:265Uitvoering:Jul 15, 2026, 6:36 AMEndpoint:http://localhost:8080/transcribe
06710083.1%
Nauwkeurigheid

265/265 samples getranscribeerd · 100% succes

06710016.9%
Woordfoutpercentage

Lager is beter · over 265 samples

Kernmetrics
Tekenfoutpercentage7.4%
Gem. snelheidsfactor1.98×realtime veelvoud
Totale snelheidsfactor1.98×
Gem. latentie per sample3.7s
Totaal verwerkte audio1849.3s30.8 min

Prijs

Google STT-lijstprijs voor batch-transcriptie. Geen kortingen of onderhandelde tarieven — het ruwe tarief per minuut.

Per 1000 minuten
$16
batch
Per minuut
$0.0160
effectief
Per 1000 min (deze 30.8 min)
$29.59
zou kosten
Open source?
propriëtair

Prijsbron: publieke prijzen van Google STT. Duudlaga Flow wordt alleen ter context getoond — deze pagina isoleert Google STT zodat het getal niet wordt opgeblazen door ons eigen product.

WER en CER per dataset

Woord- en tekenfoutpercentages per dataset. Lager is beter — en dit zijn de echte Google STT-cijfers, die zwak zijn op Common Voice 24.

Common Voice 24 (MN)
Brondataset →
WER
16.7%
CER
6%
Shunya Labs Mongolian Speech
Brondataset →
WER
10.5%
CER
4%
Common Voice 20 (MN)
Brondataset →
WER
21.3%
CER
8.7%
Modern Voice
WER
18.7%
CER
9.9%
WERCER

Overzicht per dataset

Geaggregeerde nauwkeurigheid, snelheid en timing per dataset.

DatasetBronMonstersSuccesWERCERNauwkeurigheidSnelheidAudio (s)Verw. (s)
Common Voice 24 (MN)Hugging Face →5959/5916.7%6%83.3%2.03×ss
Shunya Labs Mongolian SpeechHugging Face →6060/6010.5%4%89.5%2.45×ss
Common Voice 20 (MN)Hugging Face →5454/5421.3%8.7%78.7%1.44×ss
Modern Voice9292/9218.7%9.9%81.3%2.06×603.8s293s

WER vs. snelheid — per sample

Elke stip is één audiosample. De sweet spot is linksonder (weinig fouten, snel). Google STT scoort hoog op fouten bij veel Common Voice 24-samples.

Resultaten per sample

De ground truth wordt ongewijzigd getoond in de kolom Verwacht. De resultaatkolom markeert alleen de woorden die Google STT fout had in rood — geen doorhalingen of wissels, alleen de fouten.

265 rijen
roodfout woord in het resultaatnormaalcorrect getranscribeerdDe kolom Verwacht wordt ongewijzigd als ground truth getoond
#AudioMonsterDatasetVerwacht (ground truth)Google STT-resultaatWERCERI/D/S
1btsee-cv24-mn-0001Common Voice 24 (MN)Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье.Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье.0.0%0.0%0/0/0
2btsee-cv24-mn-0002Common Voice 24 (MN)Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү?Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү?0.0%0.0%0/0/0
3btsee-cv24-mn-0003Common Voice 24 (MN)Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе.Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе.0.0%0.0%0/0/0
4btsee-cv24-mn-0004Common Voice 24 (MN)Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн.Би бол голдуу хээрээр гэр хэцээр дэр хийж явдаг хүн.0.0%0.0%0/0/0
5btsee-cv24-mn-0005Common Voice 24 (MN)Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ.Хаан Хормистуусын болтугай баруун хоёр дахь луугаар нэргүүлэхээр явжээ.100.0%41.6%0/1/9
6btsee-cv24-mn-0006Common Voice 24 (MN)Алив наашаа ороод ир гээд гэртээ оров.Алив наашаа ороод ир гээд гэртээ оров.0.0%0.0%0/0/0
7btsee-cv24-mn-0007Common Voice 24 (MN)Өө өндөр дээдэс таны тухайд би баталж чадахгүй.Өө, өндөр дээдэс, таны тухайд би баталж чадахгүй.0.0%0.0%0/0/0
8btsee-cv24-mn-0008Common Voice 24 (MN)Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.Харин гурав дахь удаагаасаа эхлэн хүмүүсийг сонирхож эхлэв.12.5%3.6%0/0/1
9btsee-cv24-mn-0009Common Voice 24 (MN)Та нар очингуутаа шөл л өгч үз.Та нар очингуутаа шүлэл өгч үз.28.6%6.7%0/1/1
10btsee-cv24-mn-0010Common Voice 24 (MN)Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь.Ерөөсөө л үйлдвэрээсээ салаагүй явсан юм чинь.14.3%6.2%0/0/1
Pagina 1 van 27

Methodologie

Hoe deze getallen zijn verkregen.

Leverancier: Google STT (Google Cloud Speech-to-Text V2 raw transcription.).

Endpoint http://localhost:8080/transcribe. Taal mn-MN. Leestekens verwijderd voor WER.

Datasets: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 samples, in totaal 1849.3s audio.

Bron-URL's van datasets:

Metrieken: WER en CER worden berekend met een standaard woord-/teken-Levenshtein-uitlijning, genormaliseerd voor hoofdletters en leestekens. Nauwkeurigheid = 100 − WER. Snelheidsfactor = audioduur ÷ verwerkingstijd (× realtime). Alle verzoeken zijn echte Google STT-Batch-API-aanroepen, niet gecached of gesimuleerd.

Verschilmarkering: De resultaatkolom wordt uitgelijnd op de ground truth en kleurt elke substitutie en insertie rood. Deleties (woorden die ontbreken in het resultaat) worden niet in de resultaatkolom getoond — de kolom Verwacht bevat al de volledige ground truth ongewijzigd.

Gegenereerd door Google STT Benchmark Runner · Google STT Batch API v2 · uitvoering Jul 15, 2026, 6:36 AM