Bảng xếp hạng chuyển giọng nói thành văn bản tiếng Mông Cổ
So sánh tỷ lệ lỗi từ, tốc độ và giá giữa các nhà cung cấp chuyển giọng nói thành văn bản cho tiếng Mông Cổ. Mọi con số đo trên âm thanh Mông Cổ thực — không phải tiếp thị.
Bộ dữ liệu đã dùng
Các kho ngữ liệu tiếng nói công khai dùng cho mỗi lần chạy của nhà cung cấp. Mở liên kết nguồn để xem mô tả bộ dữ liệu, giấy phép và bản tải về.
- Common Voice 24 (MN)›https://huggingface.co/datasets/btsee/common-voices-24-mn
- Shunya Labs Mongolian Speech›https://huggingface.co/datasets/shunyalabs/mongolian-speech-dataset
- Common Voice 20 (MN)›https://huggingface.co/datasets/warmestman/common-voice-20-mn-normalized
- Modern Voice›Do chúng tôi tự thu cho bài đo này — không phát hành âm thanh, chỉ công bố số liệu.
WER so với tốc độ
Mỗi chấm là một nhà cung cấp. Vị trí lý tưởng ở góc dưới bên phải (ít lỗi, nhanh). Đo trên âm thanh Mông Cổ thực.
So sánh nhà cung cấp
Sắp xếp bất kỳ cột nào. Bấm Chi tiết để xem phân tích từng mẫu, giá và phương pháp của một nhà cung cấp.
| Nhà cung cấp | WER ↑ | CER | Độ chính xác | Tốc độ | Độ trễ | Giá / 1000 phút | |
|---|---|---|---|---|---|---|---|
Speechmatics | 14.4% | 7.4% | 85.6% | 0.51× | 13.8s | $8.5 | Chi tiết |
Duudlaga FlowCủa chúng tôi | 14.6% | 7.6% | 85.4% | 1.47× | 5.2s | $19.4 | Chi tiết |
Chimege | 14.6% | 6.6% | 85.4% | 1.51× | 4.7s | $11.1 | Chi tiết |
Google STT | 16.9% | 7.4% | 83.1% | 1.98× | 3.7s | $16 | Chi tiết |
Whisper large-v2 MN | 20.7% | 8.3% | 79.3% | 0.53× | 13.5s | $0 | Chi tiết |
Azure Speech | 20.8% | 9.7% | 79.2% | 0.39× | 17.3s | $16.7 | Chi tiết |
Whisper medium MNTrùng lặp | 22.5% | 8.9% | 77.5% | 2.7× | 2.7s | $0 | Chi tiết |
SeamlessM4T v2 | 24% | 11.1% | 76% | 0.39× | 26.3s | $0 | Chi tiết |
Whisper turbo MNTrùng lặp | 25.7% | 9.2% | 74.3% | 2.43× | 3.0s | $0 | Chi tiết |
ElevenLabs Scribe v1 | 27.1% | 10.8% | 72.9% | 2.14× | 3.3s | $6.7 | Chi tiết |
ElevenLabs Scribe v2 | 27.1% | 10.6% | 72.9% | 1.51× | 4.7s | $3.7 | Chi tiết |
Gemma 4 | 30.2% | 14.7% | 69.8% | 1× | 7.3s | $0 | Chi tiết |
OmniASR LLM-1B | 33.8% | 14.2% | 66.2% | 0.27× | 26.6s | $0 | Chi tiết |
Whisper large-v3 MNTrùng lặp | 39.4% | 14.9% | 60.6% | 1.57× | 4.5s | $0 | Chi tiết |
MMS-1B-all | 41.7% | 12.3% | 58.3% | 19.2× | 0.4s | $0 | Chi tiết |
wav2vec2 XLSR-53 MNTrùng lặp | 45% | 16.4% | 55% | 42.32× | 0.2s | $0 | Chi tiết |
Dolphin small | 49.1% | 19.2% | 50.9% | 1.73× | 4.1s | $0 | Chi tiết |
OmniASR CTC-1B | 51.2% | 15.5% | 48.8% | 0.6× | 11.7s | $0 | Chi tiết |
GPT-4o Transcribe | 53% | 27.6% | 47% | 2.11× | 3.7s | $6 | Chi tiết |
Moonshine MNTrùng lặp | 58.8% | 45.2% | 41.2% | 8.44× | 0.8s | $0 | Chi tiết |
Whisper large-v3 | 89.5% | 37.4% | 10.5% | 1.29× | 6.0s | $0 | Chi tiết |
Gladia | 90.1% | 38.9% | 9.9% | 0.75× | 9.4s | $10.2 | Chi tiết |
Whisper large-v3-turbo | 99% | 54.4% | 1% | 0.91× | 8.7s | $0 | Chi tiết |
Qwen3-ASR-Flash | 103.7% | 86.4% | -3.7% | 2.19× | 3.2s | $2.1 | Chi tiết |
OpenAI Whisper | 105.2% | 63.7% | -5.2% | 1.5× | 4.5s | $6 | Chi tiết |
VibeVoice ASR | 107% | 61% | -7% | 0.53× | 12.1s | $0 | Chi tiết |
Gemini Flash | Sắp có kết quả benchmark | ||||||
Mọi kết quả đo trên bộ dữ liệu Mông Cổ thực. Tốc độ là × thời gian thực (cao hơn = nhanh hơn). WER thấp hơn là tốt hơn.
Trùng lặp— Các mô hình có huy hiệu này được huấn luyện trên dữ liệu trùng với kho ngữ liệu của bài đo (Common Voice tiếng Mông Cổ — 113 trong 173 mẫu — hoặc kho ngữ liệu công khai của Shunya Labs). Điểm trên kho ngữ liệu trùng lặp bị thổi phồng do học thuộc; hãy đánh giá các mô hình này qua bảng theo từng bộ dữ liệu ở trang chi tiết, nhất là những kho ngữ liệu chúng KHÔNG được huấn luyện.
Duudlaga Voice Set
92 samples · 10.2 min · 28 systemsA second corpus recorded first-party for this benchmark, covering what the public Mongolian datasets barely contain: modern loanwords, English/Mongolian code-switching, numbers, dates, and commands. Every system is measured on the same 92 recordings.
| Nhà cung cấp | WER | CER | Độ chính xác | Tốc độ |
|---|---|---|---|---|
1Duudlaga FlowCủa chúng tôi | 9.5% | 5.3% | 90.5% | 1.27× |
2Google STT | 11.7% | 5.5% | 88.3% | 2.28× |
3Chimege | 14.5% | 6.8% | 85.5% | 1.48× |
4Speechmatics | 15.3% | 7.6% | 84.7% | 0.5× |
5Gemini 3.5 Flash | 19.5% | 11.4% | 80.5% | 0.06× |
6SeamlessM4T v2Mã nguồn mở | 22.9% | 10.4% | 77.1% | 4.32× |
7Whisper large-v2 MNMã nguồn mở | 23.2% | 10.9% | 76.8% | 0.55× |
8ElevenLabs Scribe v1 | 23.4% | 9.3% | 76.6% | 2.09× |
9ElevenLabs Scribe v2 | 24.6% | 9.8% | 75.4% | 1.47× |
10Azure Speech | 26.1% | 10.9% | 73.9% | 0.32× |
11Gemma 4Mã nguồn mở | 27.7% | 13.2% | 72.3% | 1.04× |
12OmniASR LLM-1BMã nguồn mở | 34.5% | 14.5% | 65.5% | 0.27× |
13Whisper medium MNMã nguồn mởTrùng lặp | 35.1% | 14.8% | 64.9% | 2.71× |
14Whisper turbo MNMã nguồn mởTrùng lặp | 37.6% | 14.1% | 62.4% | 2.59× |
15Whisper large-v3 MNMã nguồn mởTrùng lặp | 41% | 17.1% | 59% | 1.58× |
16GPT-4o Transcribe | 44.3% | 23.7% | 55.7% | 2.62× |
17MMS-1B-allMã nguồn mở | 45.3% | 15.1% | 54.7% | 20.52× |
18Dolphin smallMã nguồn mở | 46.1% | 19% | 53.9% | 1.69× |
19W2v-BERT 2.0 MNMã nguồn mởTrùng lặp | 46.3% | 18.2% | 53.7% | 28.12× |
20OmniASR CTC-1BMã nguồn mở | 54.9% | 18.9% | 45.1% | 0.59× |
21wav2vec2 XLSR-53 MNMã nguồn mởTrùng lặp | 56.3% | 23.9% | 43.7% | 45.7× |
22Whisper large-v3Mã nguồn mở | 87.3% | 36.6% | 12.7% | 1.55× |
23Gladia | 88.1% | 39.9% | 11.9% | 0.74× |
24Moonshine MNMã nguồn mởTrùng lặp | 96.2% | 75.7% | 3.8% | 8.36× |
25Whisper large-v3-turboMã nguồn mở | 98.1% | 57.1% | 1.9% | 1.19× |
26Qwen3-ASR-Flash | 103.6% | 89.9% | -3.6% | 2.07× |
27OpenAI Whisper | 104.6% | 63.8% | -4.6% | 1.32× |
28VibeVoice ASRMã nguồn mở | 110.1% | 64% | -10.1% | 0.4× |
Do chúng tôi tự thu cho bài đo này — không phát hành âm thanh, chỉ công bố số liệu.