لوحة تصنيف تحويل الكلام المنغولي إلى نص
Whisper large-v3نقطة التشغيل: openai/whisper-large-v3 (language=mn, task=transcribe) on mps

Whisper large-v3 — معيار تحويل الكلام المنغولي إلى نص

نتائج حقيقية من Whisper large-v3 Batch API (نقطة تشغيل محسّنة، اللغة mn) مُقيَّمة على 4 مجموعات بيانات منغولية و265 عينة صوتية. كل رقم أدناه مُقاس وليس تسويقاً. يُعرض WER والسرعة والتسعير كما هو، بصدق صارم.

اللغة:MNفصل المتحدثين:noneالعينات:265التشغيل:Aug 18, 2026, 6:22 AMنقطة النهاية:local (transformers)
06710010.5%
الدقة

265/265 عينة مُفرَّغة · نسبة نجاح 100%

06710089.5%
معدل خطأ الكلمات

الأقل أفضل · عبر 265 عينة

المقاييس الرئيسية
معدل خطأ الأحرف37.4%
متوسط معامل السرعة1.29×ضعف الزمن الحقيقي
إجمالي معامل السرعة1.29×
متوسط زمن الانتظار لكل عينة6.0s
إجمالي الصوت المُعالَج1849.3s30.8 دقيقة

التسعير

سعر قائمة Whisper large-v3 للتفريغ الدفعي. بدون خصومات أو أسعار متفاوض عليها — السعر الخام لكل دقيقة.

لكل 1000 دقيقة
$0
دفعي
لكل دقيقة
$0.0000
فعّال
لكل 1000 دقيقة (هذه 30.8 دقيقة)
$0.00
تكلفة
مفتوح المصدر؟
ملكي

مصدر التسعير: الأسعار العامة لـ Whisper large-v3. يُعرض Duudlaga Flow للسياق فقط — هذه الصفحة تعزل Whisper large-v3 حتى لا يُضخَّم الرقم بمنتجنا.

WER و CER حسب مجموعة البيانات

معدلات خطأ الكلمات والأحرف لكل مجموعة بيانات. الأقل أفضل — وهذه أرقام Whisper large-v3 الحقيقية وهي ضعيفة على Common Voice 24.

WER
91.2%
CER
38.8%
WER
86.2%
CER
33%
WER
94%
CER
41%
Modern Voice
WER
87.7%
CER
37.2%
WERCER

ملخص مجموعات البيانات

الدقة والسرعة والتوقيت المُجمَّع لكل مجموعة بيانات.

مجموعة البياناتالمصدرالعيناتالنجاحWERCERالدقةالسرعةالصوت (ث)المعالجة (ث)
Common Voice 24 (MN)Hugging Face →5959/5991.2%38.8%8.8%0.72×330.6s456.5s
Shunya Labs Mongolian SpeechHugging Face →6060/6086.2%33%13.8%1.87×645.1s344.8s
Common Voice 20 (MN)Hugging Face →5454/5494%41%6.0%1.13×269.8s238.3s
Modern Voice9292/9287.7%37.2%12.3%1.53×603.8s394.1s

WER مقابل السرعة — لكل عينة

كل نقطة هي عينة صوتية واحدة. الموقع المثالي أسفل اليسار (خطأ قليل، سرعة عالية). Whisper large-v3 لديه خطأ مرتفع في كثير من عينات Common Voice 24.

النتائج لكل عينة

تُعرض الحقيقة المرجعية كما هي في عمود "المتوقع". يُبرز عمود النتيجة بالأحمر الكلمات التي أخطأها Whisper large-v3 فقط — بدون شطب أو استبدال، فقط الأخطاء.

265 صف
أحمركلمة خاطئة في النتيجةعاديتم التفريغ بشكل صحيحيُعرض عمود "المتوقع" كما هو كحقيقة مرجعية
#الصوتالعينةمجموعة البياناتالمتوقع (الحقيقة المرجعية)نتيجة Whisper large-v3WERCERI/D/S
1btsee_0001Common Voice 24 (MN)Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье.Кэлтээ амсгол түрээ хасаа омон танд мэдэж байгаа хэлээ.87.5%32.8%1/0/6
2btsee_0002Common Voice 24 (MN)Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү?Надзай асан аджирал гэдэгээрдээ үрхүн сарай хүгцадтай байсан гэж бүх.83.3%33.3%0/2/8
3btsee_0003Common Voice 24 (MN)Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе.Атаах тээ төрч төрч энрээгээсээ салхих чигцгээ.100.0%53.8%0/0/7
4btsee_0004Common Voice 24 (MN)Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн.Би босголту хэрээр гэр хэцэр дэрхийж ябдог хүн.70.0%17.6%0/2/5
5btsee_0005Common Voice 24 (MN)Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ.Ханхурмас дуу орлос болдгой бараа үгэнээ 2 лоогуу арны эргүйлэхээр ягалж байна.120.0%51.9%2/0/10
6btsee_0006Common Voice 24 (MN)Алив наашаа ороод ир гээд гэртээ оров.Аж байнааша ородор, гэдгэжтэй оров.85.7%35.1%0/2/4
7btsee_0007Common Voice 24 (MN)Өө өндөр дээдэс таны тухайд би баталж чадахгүй.Уу, үндэр дээд таныи тухууд би бааталг чалтахгүй.87.5%28.3%0/0/7
8btsee_0008Common Voice 24 (MN)Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.Харин 3-тэг хуудагаса эхлэн хүмүүстэг сайнархаж гэлэв.75.0%35.7%0/0/6
9btsee_0009Common Voice 24 (MN)Та нар очингуутаа шөл л өгч үз.Танр очингууд шүүллэл үхж байз.100.0%50.0%0/2/5
10btsee_0010Common Voice 24 (MN)Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь.Ерөөсөөл үүлтүрөссээ салаагуу ябсан имч нь.100.0%33.3%0/1/6
صفحة 1 من 27

المنهجية

كيف حُصلت على هذه الأرقام.

المزوّد: Whisper large-v3 (OpenAI Whisper large-v3 open weights run locally with an explicit Mongolian language token — the reference open-source ASR baseline.).

نقطة النهاية local (transformers). اللغة mn. نقطة التشغيل openai/whisper-large-v3 (language=mn, task=transcribe) on mps. فصل المتحدثين none.

مجموعات البيانات: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 عينة، 1849.3 ث من الصوت إجمالاً.

عناوين URL لمصادر مجموعات البيانات:

المقاييس: يُحسب WER و CER بمحاذاة ليفنشتاين قياسية للكلمات/الأحرف مع تطبيع حالة الأحرف وعلامات الترقيم. الدقة = 100 − WER. معامل السرعة = مدة الصوت ÷ زمن المعالجة (× الزمن الحقيقي). جميع الطلبات هي استدعاءات حقيقية لـ Batch API من Whisper large-v3 وليست مخزَّنة أو محاكاة.

إبراز الفروقات: يُحاذي عمود النتيجة بالحقيقة المرجعية ويُلوّن كل استبدال وإدراج بالأحمر. لا تُعرض الحذوفات (الكلمات المفقودة من النتيجة) في عمود النتيجة — يحتوي عمود "المتوقع" على الحقيقة المرجعية كاملة كما هي.

أُنشئ بواسطة Whisper large-v3 Benchmark Runner · Whisper large-v3 Batch API v2 · تشغيل Aug 18, 2026, 6:22 AM