wav2vec2 XLSR-53 MN — معيار تحويل الكلام المنغولي إلى نص
نتائج حقيقية من wav2vec2 XLSR-53 MN Batch API (نقطة تشغيل محسّنة، اللغة mn) مُقيَّمة على 4 مجموعات بيانات منغولية و265 عينة صوتية. كل رقم أدناه مُقاس وليس تسويقاً. يُعرض WER والسرعة والتسعير كما هو، بصدق صارم.
265/265 عينة مُفرَّغة · نسبة نجاح 100%
الأقل أفضل · عبر 265 عينة
التسعير
سعر قائمة wav2vec2 XLSR-53 MN للتفريغ الدفعي. بدون خصومات أو أسعار متفاوض عليها — السعر الخام لكل دقيقة.
مصدر التسعير: الأسعار العامة لـ wav2vec2 XLSR-53 MN. يُعرض Duudlaga Flow للسياق فقط — هذه الصفحة تعزل wav2vec2 XLSR-53 MN حتى لا يُضخَّم الرقم بمنتجنا.
WER و CER حسب مجموعة البيانات
معدلات خطأ الكلمات والأحرف لكل مجموعة بيانات. الأقل أفضل — وهذه أرقام wav2vec2 XLSR-53 MN الحقيقية وهي ضعيفة على Common Voice 24.
ملخص مجموعات البيانات
الدقة والسرعة والتوقيت المُجمَّع لكل مجموعة بيانات.
| مجموعة البيانات | المصدر | العينات | النجاح | WER | CER | الدقة | السرعة | الصوت (ث) | المعالجة (ث) |
|---|---|---|---|---|---|---|---|---|---|
| Common Voice 24 (MN) | Hugging Face → | 59 | 59/59 | 37.2% | 11.4% | 62.8% | 37.32× | 330.6s | 8.9s |
| Shunya Labs Mongolian Speech | Hugging Face → | 60 | 60/60 | 44.6% | 15.3% | 55.4% | 45.18× | 645.1s | 14.3s |
| Common Voice 20 (MN) | Hugging Face → | 54 | 54/54 | 31.7% | 9.6% | 68.3% | 37.72× | 269.8s | 7.2s |
| Modern Voice | — | 92 | 92/92 | 58% | 24.3% | 42.0% | 45.1× | 603.8s | 13.4s |
WER مقابل السرعة — لكل عينة
كل نقطة هي عينة صوتية واحدة. الموقع المثالي أسفل اليسار (خطأ قليل، سرعة عالية). wav2vec2 XLSR-53 MN لديه خطأ مرتفع في كثير من عينات Common Voice 24.
النتائج لكل عينة
تُعرض الحقيقة المرجعية كما هي في عمود "المتوقع". يُبرز عمود النتيجة بالأحمر الكلمات التي أخطأها wav2vec2 XLSR-53 MN فقط — بدون شطب أو استبدال، فقط الأخطاء.
| # | الصوت | العينة | مجموعة البيانات | المتوقع (الحقيقة المرجعية) | نتيجة wav2vec2 XLSR-53 MN | WER | CER | I/D/S |
|---|---|---|---|---|---|---|---|---|
| 1 | btsee_0001 | Common Voice 24 (MN) | Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье. | гэхдээ амьсгал хураахаасаа өмнө танд мэдэж ягаагаа хэлэе | 25.0% | 6.9% | 0/0/2 | |
| 2 | btsee_0002 | Common Voice 24 (MN) | Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү? | надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж хүү | 8.3% | 1.3% | 0/0/1 | |
| 3 | btsee_0003 | Common Voice 24 (MN) | Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе. | одоо бид өөрждөө өвчин эмгийдээсээ салахыг хичээцгээ гийдэг | 57.1% | 21.2% | 1/0/3 | |
| 4 | btsee_0004 | Common Voice 24 (MN) | Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн. | би бол голдуу хээрээр гэр хэчээр дэр хийж явдаг хүн | 10.0% | 2.0% | 0/0/1 | |
| 5 | btsee_0005 | Common Voice 24 (MN) | Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ. | тав хурамжт уулаж болдоггүй бур вгүн хоёр луугаар нэргүүл хэрэгүлжээ | 90.0% | 29.9% | 0/0/9 | |
| 6 | btsee_0006 | Common Voice 24 (MN) | Алив наашаа ороод ир гээд гэртээ оров. | алив наашаа оройдр гээд гэртээ оров | 28.6% | 8.1% | 0/1/1 | |
| 7 | btsee_0007 | Common Voice 24 (MN) | Өө өндөр дээдэс таны тухайд би баталж чадахгүй. | өө өндөр дээд таны тухайд би баталж чадахгүй | 12.5% | 4.3% | 0/0/1 | |
| 8 | btsee_0008 | Common Voice 24 (MN) | Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв. | харин гурав даг удаагаас эхлэх хүмүүсийг сонирхож эхлэв | 25.0% | 5.4% | 0/0/2 | |
| 9 | btsee_0009 | Common Voice 24 (MN) | Та нар очингуутаа шөл л өгч үз. | та нар очингуутаа шүлэл өгч үз | 28.6% | 6.7% | 0/1/1 | |
| 10 | btsee_0010 | Common Voice 24 (MN) | Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь. | ерөөсөө л үйлдвэрээсээ салуугүй орсон юм чинь | 42.9% | 16.7% | 0/0/3 |
المنهجية
كيف حُصلت على هذه الأرقام.
المزوّد: wav2vec2 XLSR-53 MN (wav2vec2 XLSR-53 fine-tuned on Mongolian Common Voice — by download count the most-used Mongolian-specific open ASR model on the Hub. CTC output, so no punctuation or casing.). دُرّبت النماذج التي تحمل هذه الشارة على بيانات تتداخل مع مجموعات الاختبار المعيارية (Mongolian Common Voice — 113 عينة من أصل 173 — أو مجموعة Shunya Labs العامة). ترتفع النتائج على المجموعات المتداخلة بسبب الحفظ؛ لذا قيّم هذه النماذج من خلال جدول كل مجموعة بيانات في صفحة تفاصيلها، ولا سيما المجموعات التي لم تُدرّب عليها.
نقطة النهاية local (transformers). اللغة mn. نقطة التشغيل anton-l/wav2vec2-large-xlsr-53-mongolian (CTC) on mps. فصل المتحدثين none.
مجموعات البيانات: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 عينة، 1849.3 ث من الصوت إجمالاً.
- Common Voice 24 (MN)https://huggingface.co/datasets/btsee/common-voices-24-mn
- Shunya Labs Mongolian Speechhttps://huggingface.co/datasets/shunyalabs/mongolian-speech-dataset
- Common Voice 20 (MN)https://huggingface.co/datasets/warmestman/common-voice-20-mn-normalized
- Modern Voice—
المقاييس: يُحسب WER و CER بمحاذاة ليفنشتاين قياسية للكلمات/الأحرف مع تطبيع حالة الأحرف وعلامات الترقيم. الدقة = 100 − WER. معامل السرعة = مدة الصوت ÷ زمن المعالجة (× الزمن الحقيقي). جميع الطلبات هي استدعاءات حقيقية لـ Batch API من wav2vec2 XLSR-53 MN وليست مخزَّنة أو محاكاة.
إبراز الفروقات: يُحاذي عمود النتيجة بالحقيقة المرجعية ويُلوّن كل استبدال وإدراج بالأحمر. لا تُعرض الحذوفات (الكلمات المفقودة من النتيجة) في عمود النتيجة — يحتوي عمود "المتوقع" على الحقيقة المرجعية كاملة كما هي.