Mongolian Speech-to-Text Leaderboard
Google STTEndpoint: http://localhost:8080/transcribe

Google STT — Mongolian Speech-to-Text Benchmark

Real results from the Google STT Batch API (enhanced operating point, language mn-MN) evaluated across 4 Mongolian datasets and 265 audio samples. Every number below is measured — not marketing. WER, speed, and pricing are shown as-is, brutally honest.

Language:MN-MNSamples:265Run:Jul 15, 2026, 6:36 AMEndpoint:http://localhost:8080/transcribe
06710083.1%
Accuracy

265/265 samples transcribed · 100% success rate

06710016.9%
Word Error Rate

Lower is better · across 265 samples

Headline metrics
Character Error Rate7.4%
Avg speed factor1.98×realtime multiple
Total speed factor1.98×
Avg latency / sample3.7s
Total audio processed1849.3s30.8 min

Pricing

Google STT list pricing for batch transcription. No discounts, no negotiated rates applied — the raw per-minute rate.

Per 1k minutes
$16
batch
Per minute
$0.0160
effective
Per 1k min (these 30.8 min)
$29.59
would cost
Open source?
proprietary

Pricing source: Google STT public pricing. Duudlaga Flow is shown for context only — this page isolates Google STT so the number is not padded by our own product.

WER & CER by dataset

Word and character error rates per dataset. Lower is better — and these are the real Google STT numbers, which are weak on Common Voice 24.

Common Voice 24 (MN)
Source dataset →
WER
16.7%
CER
6%
Shunya Labs Mongolian Speech
Source dataset →
WER
10.5%
CER
4%
Common Voice 20 (MN)
Source dataset →
WER
21.3%
CER
8.7%
Modern Voice
WER
18.7%
CER
9.9%
WERCER

Dataset summary

Aggregate accuracy, speed, and timing for each dataset.

DatasetSourceSamplesSuccessWERCERAccuracySpeedAudio (s)Proc (s)
Common Voice 24 (MN)Hugging Face →5959/5916.7%6%83.3%2.03×ss
Shunya Labs Mongolian SpeechHugging Face →6060/6010.5%4%89.5%2.45×ss
Common Voice 20 (MN)Hugging Face →5454/5421.3%8.7%78.7%1.44×ss
Modern Voice9292/9218.7%9.9%81.3%2.06×603.8s293s

WER vs speed — per sample

Each dot is one audio sample. The sweet spot is the bottom-left (low error, fast). Google STT sits high on error for many Common Voice 24 samples.

Per-sample results

Ground truth shown verbatim in the Expected column. The result column highlights only the words Google STT got wrong, in red — no strikethrough/swap gymnastics, just the mistakes.

265 rows
redwrong word in the resultplaincorrectly transcribedExpected column shown verbatim as ground truth
#AudioSampleDatasetExpected (ground truth)Google STT resultWERCERI/D/S
1btsee-cv24-mn-0001Common Voice 24 (MN)Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье.Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье.0.0%0.0%0/0/0
2btsee-cv24-mn-0002Common Voice 24 (MN)Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү?Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү?0.0%0.0%0/0/0
3btsee-cv24-mn-0003Common Voice 24 (MN)Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе.Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе.0.0%0.0%0/0/0
4btsee-cv24-mn-0004Common Voice 24 (MN)Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн.Би бол голдуу хээрээр гэр хэцээр дэр хийж явдаг хүн.0.0%0.0%0/0/0
5btsee-cv24-mn-0005Common Voice 24 (MN)Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ.Хаан Хормистуусын болтугай баруун хоёр дахь луугаар нэргүүлэхээр явжээ.100.0%41.6%0/1/9
6btsee-cv24-mn-0006Common Voice 24 (MN)Алив наашаа ороод ир гээд гэртээ оров.Алив наашаа ороод ир гээд гэртээ оров.0.0%0.0%0/0/0
7btsee-cv24-mn-0007Common Voice 24 (MN)Өө өндөр дээдэс таны тухайд би баталж чадахгүй.Өө, өндөр дээдэс, таны тухайд би баталж чадахгүй.0.0%0.0%0/0/0
8btsee-cv24-mn-0008Common Voice 24 (MN)Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.Харин гурав дахь удаагаасаа эхлэн хүмүүсийг сонирхож эхлэв.12.5%3.6%0/0/1
9btsee-cv24-mn-0009Common Voice 24 (MN)Та нар очингуутаа шөл л өгч үз.Та нар очингуутаа шүлэл өгч үз.28.6%6.7%0/1/1
10btsee-cv24-mn-0010Common Voice 24 (MN)Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь.Ерөөсөө л үйлдвэрээсээ салаагүй явсан юм чинь.14.3%6.2%0/0/1
Page 1 of 27

Methodology

How these numbers were produced.

Provider: Google STT (Google Cloud Speech-to-Text V2 raw transcription.).

Endpoint http://localhost:8080/transcribe. Language mn-MN. Punctuation stripped for WER.

Datasets: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 samples, 1849.3s of audio total.

Dataset source URLs:

Metrics: WER and CER are computed with a standard word/character Levenshtein alignment, normalized for case and punctuation. Accuracy = 100 − WER. Speed factor = audio duration ÷ processing time (× realtime). All requests are real Google STT Batch API calls, not cached or simulated.

Diff highlighting: The result column aligns to the ground truth and colors every substitution and insertion red. Deletions (words missing from the result) are not shown in the result column — the Expected column already holds the full ground truth as-is.

Generated by the Google STT Benchmark Runner · Google STT Batch API v2 · run Jul 15, 2026, 6:36 AM