GPT-4o Transcribe — معیار تبدیل گفتار مغولی به متن
نتایج واقعی از GPT-4o Transcribe Batch API (نقطه عملیاتی بهبودیافته، زبان mn) ارزیابیشده روی 4 مجموعه داده مغولی و 265 نمونه صوتی. هر عدد زیر اندازهگیری شده است — بازاریابی نیست. WER، سرعت و قیمت همانگونه که هستند نمایش داده میشوند، با صداقتی بیپرده.
265/265 نمونه پیادهسازی شد · ۱۰۰٪ موفقیت
کمتر بهتر است · روی 265 نمونه
قیمت
قیمت فهرست GPT-4o Transcribe برای پیادهسازی دستهای. بدون تخفیف یا نرخ توافقی — نرخ خام به ازای هر دقیقه.
منبع قیمت: قیمتهای عمومی GPT-4o Transcribe. Duudlaga Flow فقط برای زمینه نمایش داده میشود — این صفحه GPT-4o Transcribe را جدا میکند تا عدد با محصول ما بزرگنمایی نشود.
WER و CER به ازای مجموعه داده
نرخهای خطای کلمه و نویسه به ازای مجموعه داده. کمتر بهتر است — و این اعداد واقعی GPT-4o Transcribe هستند که در Common Voice 24 ضعیفاند.
خلاصه مجموعه دادهها
دقت، سرعت و زمان تجمیعی برای هر مجموعه داده.
| مجموعه داده | Source | نمونهها | موفقیت | WER | CER | دقت | سرعت | صوت (ث) | پردازش (ث) |
|---|---|---|---|---|---|---|---|---|---|
| Common Voice 24 (MN) | Hugging Face → | 59 | 59/59 | 61.3% | 31.1% | 38.7% | 2.73× | 330.6s | 121.2s |
| Shunya Labs Mongolian Speech | Hugging Face → | 60 | 60/60 | 41.7% | 19.4% | 58.3% | 1.67× | 645.1s | 386.8s |
| Common Voice 20 (MN) | Hugging Face → | 54 | 54/54 | 65.9% | 36.4% | 34.1% | 2.01× | 269.8s | 133.9s |
| Modern Voice | — | 92 | 92/92 | 47.4% | 25.5% | 52.6% | 2.59× | 603.8s | 233.4s |
WER در برابر سرعت — به ازای نمونه
هر نقطه یک نمونه صوتی است. جای ایدهآل پایین-چپ است (خطای کم، سریع). GPT-4o Transcribe در بسیاری از نمونههای Common Voice 24 خطای بالایی دارد.
نتایج به ازای نمونه
حقیقت مرجع همانگونه که هست در ستون «مورد انتظار» نمایش داده میشود. ستون نتیجه فقط کلماتی را که GPT-4o Transcribe اشتباه کرده قرمز برجسته میکند — بدون خطخوردگی/جابهجایی، فقط اشتباهها.
| # | صدا | نمونه | مجموعه داده | مورد انتظار (حقیقت مرجع) | نتیجه GPT-4o Transcribe | WER | CER | I/D/S |
|---|---|---|---|---|---|---|---|---|
| 1 | btsee_0001 | Common Voice 24 (MN) | Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье. | Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж яваагаа хэлье. | 12.5% | 6.9% | 0/0/1 | |
| 2 | btsee_0002 | Common Voice 24 (MN) | Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү? | Надад сая санагдаж байгаа гэхэд ердөө гурван сарийн хугацаатай байсан л гэж үү? | 58.3% | 22.7% | 1/0/6 | |
| 3 | btsee_0003 | Common Voice 24 (MN) | Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе. | Одоо би дуртай хүнтэйгээ салахыг хүсч байгаа. | 85.7% | 51.9% | 0/0/6 | |
| 4 | btsee_0004 | Common Voice 24 (MN) | Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн. | Би бас голдуу хэрээр гэр, хэцэр дээр хийж явдаг хүн. | 40.0% | 9.8% | 0/0/4 | |
| 5 | btsee_0005 | Common Voice 24 (MN) | Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ. | Хаварын сүүлчээс барлагийн хоёр зоогоор нэргүүл шарив. | 100.0% | 66.2% | 0/3/7 | |
| 6 | btsee_0006 | Common Voice 24 (MN) | Алив наашаа ороод ир гээд гэртээ оров. | Айсин наашаараад ир, гэж гэртээ оров. | 57.1% | 24.3% | 0/1/3 | |
| 7 | btsee_0007 | Common Voice 24 (MN) | Өө өндөр дээдэс таны тухайд би баталж чадахгүй. | Оо, өндөртэд таныг тохойод би баталж чадахгүй. | 62.5% | 23.9% | 0/1/4 | |
| 8 | btsee_0008 | Common Voice 24 (MN) | Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв. | Харин 33 дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв. | 12.5% | 8.9% | 0/0/1 | |
| 9 | btsee_0009 | Common Voice 24 (MN) | Та нар очингуутаа шөл л өгч үз. | Та нар орчлонгоудаа шүүлт өгч үз. | 42.9% | 30.0% | 0/1/2 | |
| 10 | btsee_0010 | Common Voice 24 (MN) | Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь. | Ирүүсөөл үлдүүрээсээ салаагүй явсна юм чинь. | 57.1% | 25.0% | 0/1/3 |
روششناسی
این اعداد چگونه به دست آمدند.
ارائهدهنده: GPT-4o Transcribe (OpenAI gpt-4o-transcribe hosted transcription (Mongolian prompt hint; 'mn' is not an accepted language code).).
اندپوینت https://api.openai.com/v1/audio/transcriptions. زبان mn. Operating point gpt-4o-transcribe. تفکیک گویندگان none.
مجموعههای داده: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 نمونه، مجموعاً 1849.3s صوت.
- Common Voice 24 (MN)https://huggingface.co/datasets/btsee/common-voices-24-mn
- Shunya Labs Mongolian Speechhttps://huggingface.co/datasets/shunyalabs/mongolian-speech-dataset
- Common Voice 20 (MN)https://huggingface.co/datasets/warmestman/common-voice-20-mn-normalized
- Modern Voice—
معیارها: WER و CER با همترازی استاندارد لوناشتاین کلمه/نویسه و با نرمالسازی حروف بزرگ/کوچک و نقطهگذاری محاسبه میشوند. دقت = ۱۰۰ − WER. ضریب سرعت = مدت صوت ÷ زمان پردازش (× زمان واقعی). همه درخواستها فراخوانی واقعی Batch API GPT-4o Transcribe هستند، نه کششده یا شبیهسازیشده.
برجستهسازی تفاوتها: ستون نتیجه با حقیقت مرجع همتراز میشود و هر جایگزینی و درجی را قرمز میکند. حذفها (کلمات غایب در نتیجه) در ستون نتیجه نمایش داده نمیشوند — ستون «مورد انتظار» کل حقیقت مرجع را همانگونه که هست دربردارد.