تابلوی رتبه‌بندی تبدیل گفتار مغولی به متن
VibeVoice ASROperating point: microsoft/VibeVoice-ASR-HF (Mongolian context prompt, transcription_only) on mps

VibeVoice ASR — معیار تبدیل گفتار مغولی به متن

نتایج واقعی از VibeVoice ASR Batch API (نقطه عملیاتی بهبودیافته، زبان mn) ارزیابی‌شده روی 4 مجموعه داده مغولی و 265 نمونه صوتی. هر عدد زیر اندازه‌گیری شده است — بازاریابی نیست. WER، سرعت و قیمت همان‌گونه که هستند نمایش داده می‌شوند، با صداقتی بی‌پرده.

زبان:MNتفکیک گویندگان:noneنمونه‌ها:265اجرا:Aug 18, 2026, 8:18 PMاندپوینت:local (transformers)
067100-7%
دقت

258/265 نمونه پیاده‌سازی شد · ۱۰۰٪ موفقیت

067100107%
نرخ خطای کلمه

کمتر بهتر است · روی 265 نمونه

معیارهای اصلی
نرخ خطای نویسه61%
میانگین ضریب سرعت0.53×ضریب زمان واقعی
ضریب سرعت کل0.53×
میانگین تأخیر به ازای نمونه12.1s
کل صوت پردازش‌شده1788.5s29.8 دقیقه

قیمت

قیمت فهرست VibeVoice ASR برای پیاده‌سازی دسته‌ای. بدون تخفیف یا نرخ توافقی — نرخ خام به ازای هر دقیقه.

به ازای ۱۰۰۰ دقیقه
$0
دسته‌ای
به ازای دقیقه
$0.0000
موثر
به ازای ۱۰۰۰ دقیقه (این 29.8 دقیقه)
$0.00
هزینه
متن‌باز؟
انحصاری

منبع قیمت: قیمت‌های عمومی VibeVoice ASR. Duudlaga Flow فقط برای زمینه نمایش داده می‌شود — این صفحه VibeVoice ASR را جدا می‌کند تا عدد با محصول ما بزرگ‌نمایی نشود.

WER و CER به ازای مجموعه داده

نرخ‌های خطای کلمه و نویسه به ازای مجموعه داده. کمتر بهتر است — و این اعداد واقعی VibeVoice ASR هستند که در Common Voice 24 ضعیف‌اند.

Common Voice 24 (MN)
Source dataset →
WER
98.9%
CER
59.2%
Shunya Labs Mongolian Speech
Source dataset →
WER
114.2%
CER
58%
Common Voice 20 (MN)
Source dataset →
WER
103.8%
CER
62.2%
Modern Voice
WER
109.4%
CER
63.4%
WERCER

خلاصه مجموعه داده‌ها

دقت، سرعت و زمان تجمیعی برای هر مجموعه داده.

مجموعه دادهSourceنمونه‌هاموفقیتWERCERدقتسرعتصوت (ث)پردازش (ث)
Common Voice 24 (MN)Hugging Face →5957/5998.9%59.2%1.1%0.56×318.8s574.1s
Shunya Labs Mongolian SpeechHugging Face →6059/60114.2%58%-14.2%0.63×630.9s1003.2s
Common Voice 20 (MN)Hugging Face →5452/54103.8%62.2%-3.8%0.57×258.2s452.9s
Modern Voice9290/92109.4%63.4%-9.4%0.43×580.6s1338.1s

WER در برابر سرعت — به ازای نمونه

هر نقطه یک نمونه صوتی است. جای ایده‌آل پایین-چپ است (خطای کم، سریع). VibeVoice ASR در بسیاری از نمونه‌های Common Voice 24 خطای بالایی دارد.

نتایج به ازای نمونه

حقیقت مرجع همان‌گونه که هست در ستون «مورد انتظار» نمایش داده می‌شود. ستون نتیجه فقط کلماتی را که VibeVoice ASR اشتباه کرده قرمز برجسته می‌کند — بدون خط‌خوردگی/جابه‌جایی، فقط اشتباه‌ها.

265 ردیف
قرمزکلمه اشتباه در نتیجهسادهدرست پیاده‌سازی شدستون «مورد انتظار» همان‌گونه که هست به عنوان حقیقت مرجع نمایش داده می‌شود
#صدانمونهمجموعه دادهمورد انتظار (حقیقت مرجع)نتیجه VibeVoice ASRWERCERI/D/S
1btsee_0001Common Voice 24 (MN)Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье.Китэйм солонгос рахасаа, мөн тэнд мэдэгдэхгүй байна шүү дээ.112.5%63.8%1/0/8
2btsee_0002Common Voice 24 (MN)Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү?Надад зээс санагч ралхитэг юрдогорхон сарын хутагдай байсан гэж байна.66.7%42.7%0/2/6
3btsee_0003Common Voice 24 (MN)Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе.Атаа титурстуучин бийгээс ард хичээсгээд.100.0%55.8%0/2/5
4btsee_0004Common Voice 24 (MN)Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн.Би бас алтуу хэдэр гэр, эцэрг дэргий чи аптахуун.80.0%43.1%0/1/7
5btsee_0005Common Voice 24 (MN)Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ.Ханхан мэдээлэл, бүртгэл баруунд нэг хэсэг, зөөвөр нэг рус шүршгээ.100.0%72.7%0/0/10
6btsee_0006Common Voice 24 (MN)Алив наашаа ороод ир гээд гэртээ оров.Аз жүн байш, ороудыр, гейт кэсэдэ ороудыр.100.0%62.2%0/0/7
7btsee_0007Common Voice 24 (MN)Өө өндөр дээдэс таны тухайд би баталж чадахгүй.О, өндөртөөс танигдаж байгаа бие баталгаатай байна шүү дээ.112.5%76.1%1/0/8
8btsee_0008Common Voice 24 (MN)Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.Харин, урвдаг, удахас, яглэг, хүмүүсийг санжуулж лүү.75.0%35.7%0/1/5
9btsee_0009Common Voice 24 (MN)Та нар очингуутаа шөл л өгч үз.Танар, очонгутаа, шүлэл, юг, чүүдз.100.0%30.0%0/2/5
10btsee_0010Common Voice 24 (MN)Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь.Ирсээд үүрдүүр сэсэлтэй өгөөд сэгчихээд.100.0%72.9%0/2/5
صفحه 1 از 27

روش‌شناسی

این اعداد چگونه به دست آمدند.

ارائه‌دهنده: VibeVoice ASR (Microsoft VibeVoice-ASR (7.6B, MIT) run locally — a long-form speech LLM covering 50+ languages. Needs a Mongolian context prompt: without it, language auto-detection picks the wrong script entirely.).

اندپوینت local (transformers). زبان mn. Operating point microsoft/VibeVoice-ASR-HF (Mongolian context prompt, transcription_only) on mps. تفکیک گویندگان none.

مجموعه‌های داده: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 نمونه، مجموعاً 1788.5s صوت.

Dataset source URLs:

معیارها: WER و CER با هم‌ترازی استاندارد لون‌اشتاین کلمه/نویسه و با نرمال‌سازی حروف بزرگ‌/کوچک و نقطه‌گذاری محاسبه می‌شوند. دقت = ۱۰۰ − WER. ضریب سرعت = مدت صوت ÷ زمان پردازش (× زمان واقعی). همه درخواست‌ها فراخوانی واقعی Batch API VibeVoice ASR هستند، نه کش‌شده یا شبیه‌سازی‌شده.

برجسته‌سازی تفاوت‌ها: ستون نتیجه با حقیقت مرجع هم‌تراز می‌شود و هر جایگزینی و درجی را قرمز می‌کند. حذف‌ها (کلمات غایب در نتیجه) در ستون نتیجه نمایش داده نمی‌شوند — ستون «مورد انتظار» کل حقیقت مرجع را همان‌گونه که هست دربردارد.

تولیدشده توسط VibeVoice ASR Benchmark Runner · VibeVoice ASR Batch API v2 · اجرا Aug 18, 2026, 8:18 PM