Mongoolse spraak-naar-tekst leaderboard
Gemma 4Werkpunt: google/gemma-4-E2B-it + rookie-systems/gemma-4-audio-asr-mn-adapter (mps)

Gemma 4 — Benchmark voor Mongoolse spraak-naar-tekst

Echte resultaten van de Gemma 4 Batch API (verbeterd operationeel punt, taal mn), geëvalueerd op 4 Mongoolse datasets en 265 audiosamples. Elk getal hieronder is gemeten — geen marketing. WER, snelheid en prijs worden getoond zoals ze zijn, brutaal eerlijk.

Taal:MNDiarisatie:noneMonsters:265Uitvoering:Aug 17, 2026, 6:18 PMEndpoint:local (transformers + PEFT)
06710069.8%
Nauwkeurigheid

265/265 samples getranscribeerd · 100% succes

06710030.2%
Woordfoutpercentage

Lager is beter · over 265 samples

Kernmetrics
Tekenfoutpercentage14.7%
Gem. snelheidsfactorrealtime veelvoud
Totale snelheidsfactor
Gem. latentie per sample7.3s
Totaal verwerkte audio1849.3s30.8 min

Prijs

Gemma 4-lijstprijs voor batch-transcriptie. Geen kortingen of onderhandelde tarieven — het ruwe tarief per minuut.

Per 1000 minuten
$0
batch
Per minuut
$0.0000
effectief
Per 1000 min (deze 30.8 min)
$0.00
zou kosten
Open source?
propriëtair

Prijsbron: publieke prijzen van Gemma 4. Duudlaga Flow wordt alleen ter context getoond — deze pagina isoleert Gemma 4 zodat het getal niet wordt opgeblazen door ons eigen product.

WER en CER per dataset

Woord- en tekenfoutpercentages per dataset. Lager is beter — en dit zijn de echte Gemma 4-cijfers, die zwak zijn op Common Voice 24.

Common Voice 24 (MN)
Brondataset →
WER
32%
CER
14.3%
Shunya Labs Mongolian Speech
Brondataset →
WER
23.4%
CER
11%
Common Voice 20 (MN)
Brondataset →
WER
30.8%
CER
15.3%
Modern Voice
WER
33.1%
CER
16.9%
WERCER

Overzicht per dataset

Geaggregeerde nauwkeurigheid, snelheid en timing per dataset.

DatasetBronMonstersSuccesWERCERNauwkeurigheidSnelheidAudio (s)Verw. (s)
Common Voice 24 (MN)Hugging Face →5959/5932%14.3%68.0%0.99×330.6s334s
Shunya Labs Mongolian SpeechHugging Face →6060/6023.4%11%76.6%1.07×645.1s604.8s
Common Voice 20 (MN)Hugging Face →5454/5430.8%15.3%69.2%0.84×269.8s322.5s
Modern Voice9292/9233.1%16.9%66.9%1.02×603.8s589.6s

WER vs. snelheid — per sample

Elke stip is één audiosample. De sweet spot is linksonder (weinig fouten, snel). Gemma 4 scoort hoog op fouten bij veel Common Voice 24-samples.

Resultaten per sample

De ground truth wordt ongewijzigd getoond in de kolom Verwacht. De resultaatkolom markeert alleen de woorden die Gemma 4 fout had in rood — geen doorhalingen of wissels, alleen de fouten.

265 rijen
roodfout woord in het resultaatnormaalcorrect getranscribeerdDe kolom Verwacht wordt ongewijzigd als ground truth getoond
#AudioMonsterDatasetVerwacht (ground truth)Gemma 4-resultaatWERCERI/D/S
1btsee_0001Common Voice 24 (MN)Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье.Гэхдээ амьсгал хураанхаасаа өмнө танд мэдэж байгаагаа хэлье.12.5%1.7%0/0/1
2btsee_0002Common Voice 24 (MN)Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү?Надад заяасан газар бол гэдэг ердөө 3 хоногийн хугацаатай байсан гэж үү?33.3%22.7%0/0/4
3btsee_0003Common Voice 24 (MN)Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе.одоо бид өөрчлөлтөөр өөрийнхөө нэрийг эсээ салахыг хичээгдэхээ71.4%40.4%1/0/4
4btsee_0004Common Voice 24 (MN)Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн.гэ бол голдуу хээрээр гэр, хичээлдээ ирэх гэж явдаг хүн40.0%25.5%0/0/4
5btsee_0005Common Voice 24 (MN)Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ.Хамт хүмүүстэй уулзаж, магадгүй бүр угны хоёр рүү гарч ирэхээр явж байна.120.0%55.8%2/0/10
6btsee_0006Common Voice 24 (MN)Алив наашаа ороод ир гээд гэртээ оров.Алив наашаа ороод ир гээд гэртээ оров.0.0%0.0%0/0/0
7btsee_0007Common Voice 24 (MN)Өө өндөр дээдэс таны тухайд би баталж чадахгүй.Ө өндөр дээд таны тухайд би баталгаажуулахгүй.50.0%21.7%0/1/3
8btsee_0008Common Voice 24 (MN)Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.Харин гуравдагх удаагаас эхлэх хүмүүсийг сонирхож эхлэв.37.5%7.1%0/1/2
9btsee_0009Common Voice 24 (MN)Та нар очингуутаа шөл л өгч үз.Та нар орчингуутаа шөлө л өгч үз.28.6%6.7%0/0/2
10btsee_0010Common Voice 24 (MN)Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь.ерөөсөө л үйлдвэрээсээ салавгийн ёс юм чинь42.9%20.8%0/0/3
Pagina 1 van 27

Methodologie

Hoe deze getallen zijn verkregen.

Leverancier: Gemma 4 (google/gemma-4-E2B-it with the rookie-systems Mongolian ASR LoRA adapter, run locally on-device (open weights, no API).).

Endpoint local (transformers + PEFT). Taal mn. Werkpunt google/gemma-4-E2B-it + rookie-systems/gemma-4-audio-asr-mn-adapter (mps). Diarisatie none.

Datasets: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 samples, in totaal 1849.3s audio.

Bron-URL's van datasets:

Metrieken: WER en CER worden berekend met een standaard woord-/teken-Levenshtein-uitlijning, genormaliseerd voor hoofdletters en leestekens. Nauwkeurigheid = 100 − WER. Snelheidsfactor = audioduur ÷ verwerkingstijd (× realtime). Alle verzoeken zijn echte Gemma 4-Batch-API-aanroepen, niet gecached of gesimuleerd.

Verschilmarkering: De resultaatkolom wordt uitgelijnd op de ground truth en kleurt elke substitutie en insertie rood. Deleties (woorden die ontbreken in het resultaat) worden niet in de resultaatkolom getoond — de kolom Verwacht bevat al de volledige ground truth ongewijzigd.

Gegenereerd door Gemma 4 Benchmark Runner · Gemma 4 Batch API v2 · uitvoering Aug 17, 2026, 6:18 PM