Bảng xếp hạng chuyển giọng nói thành văn bản tiếng Mông Cổ

So sánh tỷ lệ lỗi từ, tốc độ và giá giữa các nhà cung cấp chuyển giọng nói thành văn bản cho tiếng Mông Cổ. Mọi con số đo trên âm thanh Mông Cổ thực — không phải tiếp thị.

Bộ dữ liệu đã dùng

Các kho ngữ liệu tiếng nói công khai dùng cho mỗi lần chạy của nhà cung cấp. Mở liên kết nguồn để xem mô tả bộ dữ liệu, giấy phép và bản tải về.

WER so với tốc độ

Mỗi chấm là một nhà cung cấp. Vị trí lý tưởng ở góc dưới bên phải (ít lỗi, nhanh). Đo trên âm thanh Mông Cổ thực.

Google STTDuudlaga FlowSpeechmaticsChimegeOpenAI WhisperGPT-4o TranscribeAzure SpeechGladiaGemma 4Whisper large-v3Whisper large-v3-turboWhisper large-v2 MNSeamlessM4T v2MMS-1B-allMoonshine MNwav2vec2 XLSR-53 MNWhisper turbo MNWhisper medium MNElevenLabs Scribe v1ElevenLabs Scribe v2Qwen3-ASR-FlashDolphin smallOmniASR CTC-1BOmniASR LLM-1BVibeVoice ASRWhisper large-v3 MN

So sánh nhà cung cấp

Sắp xếp bất kỳ cột nào. Bấm Chi tiết để xem phân tích từng mẫu, giá và phương pháp của một nhà cung cấp.

Nhà cung cấpWERCERĐộ chính xácTốc độĐộ trễGiá / 1000 phút
Speechmatics
14.4%7.4%85.6%0.51×13.8s$8.5Chi tiết
Duudlaga FlowCủa chúng tôi
14.6%7.6%85.4%1.47×5.2s$19.4Chi tiết
Chimege
14.6%6.6%85.4%1.51×4.7s$11.1Chi tiết
Google STT
16.9%7.4%83.1%1.98×3.7s$16Chi tiết
Whisper large-v2 MN
20.7%8.3%79.3%0.53×13.5s$0Chi tiết
Azure Speech
20.8%9.7%79.2%0.39×17.3s$16.7Chi tiết
Whisper medium MNTrùng lặp
22.5%8.9%77.5%2.7×2.7s$0Chi tiết
SeamlessM4T v2
24%11.1%76%0.39×26.3s$0Chi tiết
Whisper turbo MNTrùng lặp
25.7%9.2%74.3%2.43×3.0s$0Chi tiết
ElevenLabs Scribe v1
27.1%10.8%72.9%2.14×3.3s$6.7Chi tiết
ElevenLabs Scribe v2
27.1%10.6%72.9%1.51×4.7s$3.7Chi tiết
Gemma 4
30.2%14.7%69.8%1×7.3s$0Chi tiết
OmniASR LLM-1B
33.8%14.2%66.2%0.27×26.6s$0Chi tiết
Whisper large-v3 MNTrùng lặp
39.4%14.9%60.6%1.57×4.5s$0Chi tiết
MMS-1B-all
41.7%12.3%58.3%19.2×0.4s$0Chi tiết
wav2vec2 XLSR-53 MNTrùng lặp
45%16.4%55%42.32×0.2s$0Chi tiết
Dolphin small
49.1%19.2%50.9%1.73×4.1s$0Chi tiết
OmniASR CTC-1B
51.2%15.5%48.8%0.6×11.7s$0Chi tiết
GPT-4o Transcribe
53%27.6%47%2.11×3.7s$6Chi tiết
Moonshine MNTrùng lặp
58.8%45.2%41.2%8.44×0.8s$0Chi tiết
Whisper large-v3
89.5%37.4%10.5%1.29×6.0s$0Chi tiết
Gladia
90.1%38.9%9.9%0.75×9.4s$10.2Chi tiết
Whisper large-v3-turbo
99%54.4%1%0.91×8.7s$0Chi tiết
Qwen3-ASR-Flash
103.7%86.4%-3.7%2.19×3.2s$2.1Chi tiết
OpenAI Whisper
105.2%63.7%-5.2%1.5×4.5s$6Chi tiết
VibeVoice ASR
107%61%-7%0.53×12.1s$0Chi tiết
Gemini Flash
Sắp có kết quả benchmark

Mọi kết quả đo trên bộ dữ liệu Mông Cổ thực. Tốc độ là × thời gian thực (cao hơn = nhanh hơn). WER thấp hơn là tốt hơn.

Trùng lặpCác mô hình có huy hiệu này được huấn luyện trên dữ liệu trùng với kho ngữ liệu của bài đo (Common Voice tiếng Mông Cổ — 113 trong 173 mẫu — hoặc kho ngữ liệu công khai của Shunya Labs). Điểm trên kho ngữ liệu trùng lặp bị thổi phồng do học thuộc; hãy đánh giá các mô hình này qua bảng theo từng bộ dữ liệu ở trang chi tiết, nhất là những kho ngữ liệu chúng KHÔNG được huấn luyện.

Duudlaga Voice Set

92 samples · 10.2 min · 28 systems

A second corpus recorded first-party for this benchmark, covering what the public Mongolian datasets barely contain: modern loanwords, English/Mongolian code-switching, numbers, dates, and commands. Every system is measured on the same 92 recordings.

Nhà cung cấpWERCERĐộ chính xácTốc độ
1Duudlaga FlowCủa chúng tôi
9.5%5.3%90.5%1.27×
2Google STT
11.7%5.5%88.3%2.28×
3Chimege
14.5%6.8%85.5%1.48×
4Speechmatics
15.3%7.6%84.7%0.5×
5Gemini 3.5 Flash
19.5%11.4%80.5%0.06×
6SeamlessM4T v2Mã nguồn mở
22.9%10.4%77.1%4.32×
7Whisper large-v2 MNMã nguồn mở
23.2%10.9%76.8%0.55×
8ElevenLabs Scribe v1
23.4%9.3%76.6%2.09×
9ElevenLabs Scribe v2
24.6%9.8%75.4%1.47×
10Azure Speech
26.1%10.9%73.9%0.32×
11Gemma 4Mã nguồn mở
27.7%13.2%72.3%1.04×
12OmniASR LLM-1BMã nguồn mở
34.5%14.5%65.5%0.27×
13Whisper medium MNMã nguồn mởTrùng lặp
35.1%14.8%64.9%2.71×
14Whisper turbo MNMã nguồn mởTrùng lặp
37.6%14.1%62.4%2.59×
15Whisper large-v3 MNMã nguồn mởTrùng lặp
41%17.1%59%1.58×
16GPT-4o Transcribe
44.3%23.7%55.7%2.62×
17MMS-1B-allMã nguồn mở
45.3%15.1%54.7%20.52×
18Dolphin smallMã nguồn mở
46.1%19%53.9%1.69×
19W2v-BERT 2.0 MNMã nguồn mởTrùng lặp
46.3%18.2%53.7%28.12×
20OmniASR CTC-1BMã nguồn mở
54.9%18.9%45.1%0.59×
21wav2vec2 XLSR-53 MNMã nguồn mởTrùng lặp
56.3%23.9%43.7%45.7×
22Whisper large-v3Mã nguồn mở
87.3%36.6%12.7%1.55×
23Gladia
88.1%39.9%11.9%0.74×
24Moonshine MNMã nguồn mởTrùng lặp
96.2%75.7%3.8%8.36×
25Whisper large-v3-turboMã nguồn mở
98.1%57.1%1.9%1.19×
26Qwen3-ASR-Flash
103.6%89.9%-3.6%2.07×
27OpenAI Whisper
104.6%63.8%-4.6%1.32×
28VibeVoice ASRMã nguồn mở
110.1%64%-10.1%0.4×

Do chúng tôi tự thu cho bài đo này — không phát hành âm thanh, chỉ công bố số liệu.