تابلوی رتبه‌بندی تبدیل گفتار مغولی به متن
GPT-4o TranscribeOperating point: gpt-4o-transcribe

GPT-4o Transcribe — معیار تبدیل گفتار مغولی به متن

نتایج واقعی از GPT-4o Transcribe Batch API (نقطه عملیاتی بهبودیافته، زبان mn) ارزیابی‌شده روی 4 مجموعه داده مغولی و 265 نمونه صوتی. هر عدد زیر اندازه‌گیری شده است — بازاریابی نیست. WER، سرعت و قیمت همان‌گونه که هستند نمایش داده می‌شوند، با صداقتی بی‌پرده.

زبان:MNتفکیک گویندگان:noneنمونه‌ها:265اجرا:Aug 14, 2026, 4:21 PMاندپوینت:https://api.openai.com/v1/audio/transcriptions
06710047%
دقت

265/265 نمونه پیاده‌سازی شد · ۱۰۰٪ موفقیت

06710053%
نرخ خطای کلمه

کمتر بهتر است · روی 265 نمونه

معیارهای اصلی
نرخ خطای نویسه27.6%
میانگین ضریب سرعت2.11×ضریب زمان واقعی
ضریب سرعت کل2.11×
میانگین تأخیر به ازای نمونه3.7s
کل صوت پردازش‌شده1849.3s30.8 دقیقه

قیمت

قیمت فهرست GPT-4o Transcribe برای پیاده‌سازی دسته‌ای. بدون تخفیف یا نرخ توافقی — نرخ خام به ازای هر دقیقه.

به ازای ۱۰۰۰ دقیقه
$6
دسته‌ای
به ازای دقیقه
$0.0060
موثر
به ازای ۱۰۰۰ دقیقه (این 30.8 دقیقه)
$11.10
هزینه
متن‌باز؟
انحصاری

منبع قیمت: قیمت‌های عمومی GPT-4o Transcribe. Duudlaga Flow فقط برای زمینه نمایش داده می‌شود — این صفحه GPT-4o Transcribe را جدا می‌کند تا عدد با محصول ما بزرگ‌نمایی نشود.

WER و CER به ازای مجموعه داده

نرخ‌های خطای کلمه و نویسه به ازای مجموعه داده. کمتر بهتر است — و این اعداد واقعی GPT-4o Transcribe هستند که در Common Voice 24 ضعیف‌اند.

Common Voice 24 (MN)
Source dataset →
WER
61.3%
CER
31.1%
Shunya Labs Mongolian Speech
Source dataset →
WER
41.7%
CER
19.4%
Common Voice 20 (MN)
Source dataset →
WER
65.9%
CER
36.4%
Modern Voice
WER
47.4%
CER
25.5%
WERCER

خلاصه مجموعه داده‌ها

دقت، سرعت و زمان تجمیعی برای هر مجموعه داده.

مجموعه دادهSourceنمونه‌هاموفقیتWERCERدقتسرعتصوت (ث)پردازش (ث)
Common Voice 24 (MN)Hugging Face →5959/5961.3%31.1%38.7%2.73×330.6s121.2s
Shunya Labs Mongolian SpeechHugging Face →6060/6041.7%19.4%58.3%1.67×645.1s386.8s
Common Voice 20 (MN)Hugging Face →5454/5465.9%36.4%34.1%2.01×269.8s133.9s
Modern Voice9292/9247.4%25.5%52.6%2.59×603.8s233.4s

WER در برابر سرعت — به ازای نمونه

هر نقطه یک نمونه صوتی است. جای ایده‌آل پایین-چپ است (خطای کم، سریع). GPT-4o Transcribe در بسیاری از نمونه‌های Common Voice 24 خطای بالایی دارد.

نتایج به ازای نمونه

حقیقت مرجع همان‌گونه که هست در ستون «مورد انتظار» نمایش داده می‌شود. ستون نتیجه فقط کلماتی را که GPT-4o Transcribe اشتباه کرده قرمز برجسته می‌کند — بدون خط‌خوردگی/جابه‌جایی، فقط اشتباه‌ها.

265 ردیف
قرمزکلمه اشتباه در نتیجهسادهدرست پیاده‌سازی شدستون «مورد انتظار» همان‌گونه که هست به عنوان حقیقت مرجع نمایش داده می‌شود
#صدانمونهمجموعه دادهمورد انتظار (حقیقت مرجع)نتیجه GPT-4o TranscribeWERCERI/D/S
1btsee_0001Common Voice 24 (MN)Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье.Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж яваагаа хэлье.12.5%6.9%0/0/1
2btsee_0002Common Voice 24 (MN)Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү?Надад сая санагдаж байгаа гэхэд ердөө гурван сарийн хугацаатай байсан л гэж үү?58.3%22.7%1/0/6
3btsee_0003Common Voice 24 (MN)Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе.Одоо би дуртай хүнтэйгээ салахыг хүсч байгаа.85.7%51.9%0/0/6
4btsee_0004Common Voice 24 (MN)Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн.Би бас голдуу хэрээр гэр, хэцэр дээр хийж явдаг хүн.40.0%9.8%0/0/4
5btsee_0005Common Voice 24 (MN)Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ.Хаварын сүүлчээс барлагийн хоёр зоогоор нэргүүл шарив.100.0%66.2%0/3/7
6btsee_0006Common Voice 24 (MN)Алив наашаа ороод ир гээд гэртээ оров.Айсин наашаараад ир, гэж гэртээ оров.57.1%24.3%0/1/3
7btsee_0007Common Voice 24 (MN)Өө өндөр дээдэс таны тухайд би баталж чадахгүй.Оо, өндөртэд таныг тохойод би баталж чадахгүй.62.5%23.9%0/1/4
8btsee_0008Common Voice 24 (MN)Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.Харин 33 дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.12.5%8.9%0/0/1
9btsee_0009Common Voice 24 (MN)Та нар очингуутаа шөл л өгч үз.Та нар орчлонгоудаа шүүлт өгч үз.42.9%30.0%0/1/2
10btsee_0010Common Voice 24 (MN)Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь.Ирүүсөөл үлдүүрээсээ салаагүй явсна юм чинь.57.1%25.0%0/1/3
صفحه 1 از 27

روش‌شناسی

این اعداد چگونه به دست آمدند.

ارائه‌دهنده: GPT-4o Transcribe (OpenAI gpt-4o-transcribe hosted transcription (Mongolian prompt hint; 'mn' is not an accepted language code).).

اندپوینت https://api.openai.com/v1/audio/transcriptions. زبان mn. Operating point gpt-4o-transcribe. تفکیک گویندگان none.

مجموعه‌های داده: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 نمونه، مجموعاً 1849.3s صوت.

Dataset source URLs:

معیارها: WER و CER با هم‌ترازی استاندارد لون‌اشتاین کلمه/نویسه و با نرمال‌سازی حروف بزرگ‌/کوچک و نقطه‌گذاری محاسبه می‌شوند. دقت = ۱۰۰ − WER. ضریب سرعت = مدت صوت ÷ زمان پردازش (× زمان واقعی). همه درخواست‌ها فراخوانی واقعی Batch API GPT-4o Transcribe هستند، نه کش‌شده یا شبیه‌سازی‌شده.

برجسته‌سازی تفاوت‌ها: ستون نتیجه با حقیقت مرجع هم‌تراز می‌شود و هر جایگزینی و درجی را قرمز می‌کند. حذف‌ها (کلمات غایب در نتیجه) در ستون نتیجه نمایش داده نمی‌شوند — ستون «مورد انتظار» کل حقیقت مرجع را همان‌گونه که هست دربردارد.

تولیدشده توسط GPT-4o Transcribe Benchmark Runner · GPT-4o Transcribe Batch API v2 · اجرا Aug 14, 2026, 4:21 PM