VibeVoice ASR — منگولین speech-to-text بینچ مارک
VibeVoice ASR Batch API (بہتر آپریٹنگ پوائنٹ، زبان mn) کے 4 منگولین ڈیٹاسیٹ اور 265 آڈیو نمونوں پر جانچے گئے حقیقی نتائج۔ نیچے کا ہر عدد ناپا گیا ہے — مارکیٹنگ نہیں۔ WER، رفتار اور قیمت جیسی ہے ویسی ہی، سخت ایمانداری سے دکھائے گئے ہیں۔
258/265 نمونے ٹرانسکرائب · 100% کامیابی
کم بہتر ہے · 265 نمونوں پر
قیمت
بیچ ٹرانسکرپشن کے لیے VibeVoice ASR کی فہرستی قیمت۔ کوئی رعایت یا بات چت کی شرح نہیں — فی منٹ خام شرح۔
قیمت کا ذریعہ: VibeVoice ASR عوامی قیمتیں۔ Duudlaga Flow صرف سیاق کے لیے دکھایا گیا ہے — یہ صفحہ VibeVoice ASR کو الگ رکھتا ہے تاکہ عدد ہماری مصنوعات سے پھولا نہ ہو۔
ڈیٹاسیٹ کے حساب سے WER اور CER
ڈیٹاسیٹ کے حساب سے لفظ اور حرف غلطی کی شرحیں۔ کم بہتر ہے — اور یہ VibeVoice ASR کے حقیقی اعداد ہیں، جو Common Voice 24 پر کمزور ہیں۔
ڈیٹاسیٹ خلاصہ
ہر ڈیٹاسیٹ کی مجموعی درستگی، رفتار اور وقت۔
| ڈیٹاسیٹ | Source | نمونے | کامیابی | WER | CER | درستگی | رفتار | آڈیو (سیکنڈ) | پروسیس (سیکنڈ) |
|---|---|---|---|---|---|---|---|---|---|
| Common Voice 24 (MN) | Hugging Face → | 59 | 57/59 | 98.9% | 59.2% | 1.1% | 0.56× | 318.8s | 574.1s |
| Shunya Labs Mongolian Speech | Hugging Face → | 60 | 59/60 | 114.2% | 58% | -14.2% | 0.63× | 630.9s | 1003.2s |
| Common Voice 20 (MN) | Hugging Face → | 54 | 52/54 | 103.8% | 62.2% | -3.8% | 0.57× | 258.2s | 452.9s |
| Modern Voice | — | 92 | 90/92 | 109.4% | 63.4% | -9.4% | 0.43× | 580.6s | 1338.1s |
WER بمقابلہ رفتار — فی نمونہ
ہر نقطہ ایک آڈیو نمونہ ہے۔ بہترین جگہ نیچے بائیں (کم غلطی، تیز) ہے۔ VibeVoice ASR کئی Common Voice 24 نمونوں پر زیادہ غلطی رکھتا ہے۔
فی نمونہ نتائج
متوقع کالم میں حقیقی حوالہ جیسا ہے ویسی ہی دکھایا گیا ہے۔ نتائج کالم صرف ان الفاظ کو سرخ میں نمایاں کرتا ہے جو VibeVoice ASR غلط کر گیا — کوئی اسٹرائیک تھرو/تبدیلی نہیں، صرف غلطیاں۔
| # | آڈیو | نمونہ | ڈیٹاسیٹ | متوقع (حقیقی حوالہ) | VibeVoice ASR نتیجہ | WER | CER | I/D/S |
|---|---|---|---|---|---|---|---|---|
| 1 | btsee_0001 | Common Voice 24 (MN) | Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье. | Китэйм солонгос рахасаа, мөн тэнд мэдэгдэхгүй байна шүү дээ. | 112.5% | 63.8% | 1/0/8 | |
| 2 | btsee_0002 | Common Voice 24 (MN) | Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү? | Надад зээс санагч ралхитэг юрдогорхон сарын хутагдай байсан гэж байна. | 66.7% | 42.7% | 0/2/6 | |
| 3 | btsee_0003 | Common Voice 24 (MN) | Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе. | Атаа титурстуучин бийгээс ард хичээсгээд. | 100.0% | 55.8% | 0/2/5 | |
| 4 | btsee_0004 | Common Voice 24 (MN) | Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн. | Би бас алтуу хэдэр гэр, эцэрг дэргий чи аптахуун. | 80.0% | 43.1% | 0/1/7 | |
| 5 | btsee_0005 | Common Voice 24 (MN) | Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ. | Ханхан мэдээлэл, бүртгэл баруунд нэг хэсэг, зөөвөр нэг рус шүршгээ. | 100.0% | 72.7% | 0/0/10 | |
| 6 | btsee_0006 | Common Voice 24 (MN) | Алив наашаа ороод ир гээд гэртээ оров. | Аз жүн байш, ороудыр, гейт кэсэдэ ороудыр. | 100.0% | 62.2% | 0/0/7 | |
| 7 | btsee_0007 | Common Voice 24 (MN) | Өө өндөр дээдэс таны тухайд би баталж чадахгүй. | О, өндөртөөс танигдаж байгаа бие баталгаатай байна шүү дээ. | 112.5% | 76.1% | 1/0/8 | |
| 8 | btsee_0008 | Common Voice 24 (MN) | Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв. | Харин, урвдаг, удахас, яглэг, хүмүүсийг санжуулж лүү. | 75.0% | 35.7% | 0/1/5 | |
| 9 | btsee_0009 | Common Voice 24 (MN) | Та нар очингуутаа шөл л өгч үз. | Танар, очонгутаа, шүлэл, юг, чүүдз. | 100.0% | 30.0% | 0/2/5 | |
| 10 | btsee_0010 | Common Voice 24 (MN) | Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь. | Ирсээд үүрдүүр сэсэлтэй өгөөд сэгчихээд. | 100.0% | 72.9% | 0/2/5 |
طریقہ کار
یہ اعداد کیسے حاصل ہوئے۔
فراہم کنندہ: VibeVoice ASR (Microsoft VibeVoice-ASR (7.6B, MIT) run locally — a long-form speech LLM covering 50+ languages. Needs a Mongolian context prompt: without it, language auto-detection picks the wrong script entirely.).
اینڈپوائنٹ local (transformers). زبان mn. Operating point microsoft/VibeVoice-ASR-HF (Mongolian context prompt, transcription_only) on mps. اسپیکر علیحدگی none.
ڈیٹاسیٹ: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 نمونے، کل 1788.5s آڈیو۔
- Common Voice 24 (MN)https://huggingface.co/datasets/btsee/common-voices-24-mn
- Shunya Labs Mongolian Speechhttps://huggingface.co/datasets/shunyalabs/mongolian-speech-dataset
- Common Voice 20 (MN)https://huggingface.co/datasets/warmestman/common-voice-20-mn-normalized
- Modern Voice—
میٹرکس: WER اور CER معیاری لفظ/حرف لیونشٹائن المنت سے، حروف کے حجم اور اوقاف کے لیے نارملائز کر کے حساب کیے جاتے ہیں۔ درستگی = 100 − WER۔ رفتار فیکٹر = آڈیو دورانیہ ÷ پروسیسنگ وقت (× ریئل ٹائم)۔ تمام درخواستیں حقیقی VibeVoice ASR Batch API کالز ہیں، کیشڈ یا سمیولیٹڈ نہیں۔
فرق نمایاں کرنا: نتائج کالم حقیقی حوالہ کے ساتھ منتظم ہوتا ہے اور ہر متبادل اور شامل شدہ کو سرخ کرتا ہے۔ حذف شدہ (نتائج سے غائب الفاظ) نتائج کالم میں نہیں دکھائے جاتے — متوقع کالم پہلے ہی پوری حقیقی حوالہ جیسا ہے رکھتا ہے۔