لوحة تصنيف تحويل الكلام المنغولي إلى نص
قارن معدل خطأ الكلمات والسرعة والسعر بين مزوّدي تحويل الكلام إلى نص للمنغولية. كل رقم مُقاس على صوت منغولي حقيقي — لا تسويقاً.
مجموعات البيانات المستخدمة
مجموعات كلام عامة استُخدمت في كل تشغيل لمقدمي الخدمة. افتح عنوان URL للمصدر للاطلاع على بطاقة مجموعة البيانات الأصلية والترخيص والتنزيل.
- Common Voice 24 (MN)›https://huggingface.co/datasets/btsee/common-voices-24-mn
- Shunya Labs Mongolian Speech›https://huggingface.co/datasets/shunyalabs/mongolian-speech-dataset
- Common Voice 20 (MN)›https://huggingface.co/datasets/warmestman/common-voice-20-mn-normalized
- Modern Voice›سُجّل مباشرةً لهذا الاختبار المعياري — لا يُوزّع الصوت، وتتاح المقاييس فقط.
WER مقابل السرعة
كل نقطة مزوّد واحد. الموقع المثالي أسفل اليمين (خطأ قليل، سرعة عالية). مُقاس على صوت منغولي حقيقي.
مقارنة المزوّدين
افرز أي عمود. اضغط التفاصيل للاطلاع على تفصيل العينات والأسعار والمنهجية لمزوّد.
| المزوّد | WER ↑ | CER | الدقة | السرعة | زمن الانتظار | السعر / 1000 دقيقة | |
|---|---|---|---|---|---|---|---|
Speechmatics | 14.4% | 7.4% | 85.6% | 0.51× | 13.8s | $8.5 | التفاصيل |
Duudlaga Flowلنا | 14.6% | 7.6% | 85.4% | 1.47× | 5.2s | $19.4 | التفاصيل |
Chimege | 14.6% | 6.6% | 85.4% | 1.51× | 4.7s | $11.1 | التفاصيل |
Google STT | 16.9% | 7.4% | 83.1% | 1.98× | 3.7s | $16 | التفاصيل |
Whisper large-v2 MN | 20.7% | 8.3% | 79.3% | 0.53× | 13.5s | $0 | التفاصيل |
Azure Speech | 20.8% | 9.7% | 79.2% | 0.39× | 17.3s | $16.7 | التفاصيل |
Whisper medium MNالتداخل | 22.5% | 8.9% | 77.5% | 2.7× | 2.7s | $0 | التفاصيل |
SeamlessM4T v2 | 24% | 11.1% | 76% | 0.39× | 26.3s | $0 | التفاصيل |
Whisper turbo MNالتداخل | 25.7% | 9.2% | 74.3% | 2.43× | 3.0s | $0 | التفاصيل |
ElevenLabs Scribe v1 | 27.1% | 10.8% | 72.9% | 2.14× | 3.3s | $6.7 | التفاصيل |
ElevenLabs Scribe v2 | 27.1% | 10.6% | 72.9% | 1.51× | 4.7s | $3.7 | التفاصيل |
Gemma 4 | 30.2% | 14.7% | 69.8% | 1× | 7.3s | $0 | التفاصيل |
OmniASR LLM-1B | 33.8% | 14.2% | 66.2% | 0.27× | 26.6s | $0 | التفاصيل |
Whisper large-v3 MNالتداخل | 39.4% | 14.9% | 60.6% | 1.57× | 4.5s | $0 | التفاصيل |
MMS-1B-all | 41.7% | 12.3% | 58.3% | 19.2× | 0.4s | $0 | التفاصيل |
wav2vec2 XLSR-53 MNالتداخل | 45% | 16.4% | 55% | 42.32× | 0.2s | $0 | التفاصيل |
Dolphin small | 49.1% | 19.2% | 50.9% | 1.73× | 4.1s | $0 | التفاصيل |
OmniASR CTC-1B | 51.2% | 15.5% | 48.8% | 0.6× | 11.7s | $0 | التفاصيل |
GPT-4o Transcribe | 53% | 27.6% | 47% | 2.11× | 3.7s | $6 | التفاصيل |
Moonshine MNالتداخل | 58.8% | 45.2% | 41.2% | 8.44× | 0.8s | $0 | التفاصيل |
Whisper large-v3 | 89.5% | 37.4% | 10.5% | 1.29× | 6.0s | $0 | التفاصيل |
Gladia | 90.1% | 38.9% | 9.9% | 0.75× | 9.4s | $10.2 | التفاصيل |
Whisper large-v3-turbo | 99% | 54.4% | 1% | 0.91× | 8.7s | $0 | التفاصيل |
Qwen3-ASR-Flash | 103.7% | 86.4% | -3.7% | 2.19× | 3.2s | $2.1 | التفاصيل |
OpenAI Whisper | 105.2% | 63.7% | -5.2% | 1.5× | 4.5s | $6 | التفاصيل |
VibeVoice ASR | 107% | 61% | -7% | 0.53× | 12.1s | $0 | التفاصيل |
Gemini Flash | المعيار قريباً | ||||||
جميع النتائج مُقاسة على مجموعات بيانات منغولية حقيقية. السرعة × الزمن الحقيقي (أعلى = أسرع). WER أقل أفضل.
التداخل— دُرّبت النماذج التي تحمل هذه الشارة على بيانات تتداخل مع مجموعات الاختبار المعيارية (Mongolian Common Voice — 113 عينة من أصل 173 — أو مجموعة Shunya Labs العامة). ترتفع النتائج على المجموعات المتداخلة بسبب الحفظ؛ لذا قيّم هذه النماذج من خلال جدول كل مجموعة بيانات في صفحة تفاصيلها، ولا سيما المجموعات التي لم تُدرّب عليها.
Duudlaga Voice Set
92 samples · 10.2 min · 28 systemsA second corpus recorded first-party for this benchmark, covering what the public Mongolian datasets barely contain: modern loanwords, English/Mongolian code-switching, numbers, dates, and commands. Every system is measured on the same 92 recordings.
| المزوّد | WER | CER | الدقة | السرعة |
|---|---|---|---|---|
1Duudlaga Flowلنا | 9.5% | 5.3% | 90.5% | 1.27× |
2Google STT | 11.7% | 5.5% | 88.3% | 2.28× |
3Chimege | 14.5% | 6.8% | 85.5% | 1.48× |
4Speechmatics | 15.3% | 7.6% | 84.7% | 0.5× |
5Gemini 3.5 Flash | 19.5% | 11.4% | 80.5% | 0.06× |
6SeamlessM4T v2مفتوح المصدر | 22.9% | 10.4% | 77.1% | 4.32× |
7Whisper large-v2 MNمفتوح المصدر | 23.2% | 10.9% | 76.8% | 0.55× |
8ElevenLabs Scribe v1 | 23.4% | 9.3% | 76.6% | 2.09× |
9ElevenLabs Scribe v2 | 24.6% | 9.8% | 75.4% | 1.47× |
10Azure Speech | 26.1% | 10.9% | 73.9% | 0.32× |
11Gemma 4مفتوح المصدر | 27.7% | 13.2% | 72.3% | 1.04× |
12OmniASR LLM-1Bمفتوح المصدر | 34.5% | 14.5% | 65.5% | 0.27× |
13Whisper medium MNمفتوح المصدرالتداخل | 35.1% | 14.8% | 64.9% | 2.71× |
14Whisper turbo MNمفتوح المصدرالتداخل | 37.6% | 14.1% | 62.4% | 2.59× |
15Whisper large-v3 MNمفتوح المصدرالتداخل | 41% | 17.1% | 59% | 1.58× |
16GPT-4o Transcribe | 44.3% | 23.7% | 55.7% | 2.62× |
17MMS-1B-allمفتوح المصدر | 45.3% | 15.1% | 54.7% | 20.52× |
18Dolphin smallمفتوح المصدر | 46.1% | 19% | 53.9% | 1.69× |
19W2v-BERT 2.0 MNمفتوح المصدرالتداخل | 46.3% | 18.2% | 53.7% | 28.12× |
20OmniASR CTC-1Bمفتوح المصدر | 54.9% | 18.9% | 45.1% | 0.59× |
21wav2vec2 XLSR-53 MNمفتوح المصدرالتداخل | 56.3% | 23.9% | 43.7% | 45.7× |
22Whisper large-v3مفتوح المصدر | 87.3% | 36.6% | 12.7% | 1.55× |
23Gladia | 88.1% | 39.9% | 11.9% | 0.74× |
24Moonshine MNمفتوح المصدرالتداخل | 96.2% | 75.7% | 3.8% | 8.36× |
25Whisper large-v3-turboمفتوح المصدر | 98.1% | 57.1% | 1.9% | 1.19× |
26Qwen3-ASR-Flash | 103.6% | 89.9% | -3.6% | 2.07× |
27OpenAI Whisper | 104.6% | 63.8% | -4.6% | 1.32× |
28VibeVoice ASRمفتوح المصدر | 110.1% | 64% | -10.1% | 0.4× |
سُجّل مباشرةً لهذا الاختبار المعياري — لا يُوزّع الصوت، وتتاح المقاييس فقط.