मंगोलियाई स्पीच-टू-टेक्स्ट लीडरबोर्ड
GPT-4o Transcribeऑपरेटिंग पॉइंट: gpt-4o-transcribe

GPT-4o Transcribe — मंगोलियाई स्पीच-टू-टेक्स्ट बेंचमार्क

GPT-4o Transcribe Batch API (उन्नत संचालन बिंदु, भाषा mn) द्वारा 4 मंगोलियाई डेटासेट और 265 ऑडियो नमूनों पर निर्धारित वास्तविक परिणाम। नीचे का हर अंक मापा गया है — मार्केटिंग नहीं। WER, गति और मूल्य जैसा है वैसे ही, कठोर ईमानदारी से दिखाए गए हैं।

भाषा:MNवक्ता पृथक्करण:noneनमूने:265चलाना:Aug 14, 2026, 4:21 PMएंडपॉइंट:https://api.openai.com/v1/audio/transcriptions
06710047%
सटीकता

265/265 नमूने ट्रांसक्राइब किए गए · 100% सफलता

06710053%
शब्द त्रुटि दर

कम बेहतर है · 265 नमूनों पर

मुख्य मेट्रिक्स
अक्षर त्रुटि दर27.6%
औसत गति गुणांक2.11×रियल-टाइम गुणक
कुल गति गुणांक2.11×
प्रति नमूना औसत विलंबता3.7s
कुल संसाधित ऑडियो1849.3s30.8 मिनट

मूल्य

बैच ट्रांसक्रिप्शन के लिए GPT-4o Transcribe की सूची मूल्य। कोई छूट या परक्राम्य दर नहीं — प्रति मिनट कच्चा दर।

प्रति 1000 मिनट
$6
बैच
प्रति मिनट
$0.0060
प्रभावी
प्रति 1000 मिनट (ये 30.8 मिनट)
$11.10
लागत
ओपन सोर्स?
स्वामित्व

मूल्य स्रोत: GPT-4o Transcribe सार्वजनिक मूल्य। Duudlaga Flow केवल संदर्भ हेतु दिखाया गया है — यह पृष्ठ GPT-4o Transcribe को अलग करता है ताकि अंक हमारे उत्पाद से न फूले।

डेटासेट अनुसार WER और CER

प्रति डेटासेट शब्द और अक्षर त्रुटि दरें। कम बेहतर है — और ये GPT-4o Transcribe के वास्तविक अंक हैं, जो Common Voice 24 पर कमज़ोर हैं।

WER
61.3%
CER
31.1%
Shunya Labs Mongolian Speech
स्रोत डेटासेट →
WER
41.7%
CER
19.4%
WER
65.9%
CER
36.4%
Modern Voice
WER
47.4%
CER
25.5%
WERCER

डेटासेट सारांश

प्रत्येक डेटासेट की सकल सटीकता, गति और समय।

डेटासेटस्रोतनमूनेसफलताWERCERसटीकतागतिऑडियो (से)प्रसं. (से)
Common Voice 24 (MN)Hugging Face →5959/5961.3%31.1%38.7%2.73×330.6s121.2s
Shunya Labs Mongolian SpeechHugging Face →6060/6041.7%19.4%58.3%1.67×645.1s386.8s
Common Voice 20 (MN)Hugging Face →5454/5465.9%36.4%34.1%2.01×269.8s133.9s
Modern Voice9292/9247.4%25.5%52.6%2.59×603.8s233.4s

WER बनाम गति — प्रति नमूना

प्रत्येक बिंदु एक ऑडियो नमूना है। आदर्श स्थान निचले-बाएँ (कम त्रुटि, तेज़) है। GPT-4o Transcribe कई Common Voice 24 नमूनों पर त्रुटि में ऊँचा है।

प्रति-नमूना परिणाम

अपेक्षित कॉलम में आधार सत्य यथावत् दिखाया गया है। परिणाम कॉलम केवल वे शब्द लाल में हाइलाइट करता है जिन्हें GPT-4o Transcribe ने गलत किया — कोई स्ट्राइकथ्रू/स्वैप नहीं, केवल त्रुटियाँ।

265 पंक्तियाँ
लालपरिणाम में गलत शब्दसाधारणसही ट्रांसक्राइब किया गयाअपेक्षित कॉलम आधार सत्य के रूप में यथावत् दिखाया गया
#ऑडियोनमूनाडेटासेटअपेक्षित (आधार सत्य)GPT-4o Transcribe परिणामWERCERI/D/S
1btsee_0001Common Voice 24 (MN)Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье.Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж яваагаа хэлье.12.5%6.9%0/0/1
2btsee_0002Common Voice 24 (MN)Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү?Надад сая санагдаж байгаа гэхэд ердөө гурван сарийн хугацаатай байсан л гэж үү?58.3%22.7%1/0/6
3btsee_0003Common Voice 24 (MN)Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе.Одоо би дуртай хүнтэйгээ салахыг хүсч байгаа.85.7%51.9%0/0/6
4btsee_0004Common Voice 24 (MN)Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн.Би бас голдуу хэрээр гэр, хэцэр дээр хийж явдаг хүн.40.0%9.8%0/0/4
5btsee_0005Common Voice 24 (MN)Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ.Хаварын сүүлчээс барлагийн хоёр зоогоор нэргүүл шарив.100.0%66.2%0/3/7
6btsee_0006Common Voice 24 (MN)Алив наашаа ороод ир гээд гэртээ оров.Айсин наашаараад ир, гэж гэртээ оров.57.1%24.3%0/1/3
7btsee_0007Common Voice 24 (MN)Өө өндөр дээдэс таны тухайд би баталж чадахгүй.Оо, өндөртэд таныг тохойод би баталж чадахгүй.62.5%23.9%0/1/4
8btsee_0008Common Voice 24 (MN)Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.Харин 33 дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.12.5%8.9%0/0/1
9btsee_0009Common Voice 24 (MN)Та нар очингуутаа шөл л өгч үз.Та нар орчлонгоудаа шүүлт өгч үз.42.9%30.0%0/1/2
10btsee_0010Common Voice 24 (MN)Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь.Ирүүсөөл үлдүүрээсээ салаагүй явсна юм чинь.57.1%25.0%0/1/3
पृष्ठ 1 / 27

कार्यप्रणाली

ये अंक कैसे प्राप्त किए गए।

प्रदाता: GPT-4o Transcribe (OpenAI gpt-4o-transcribe hosted transcription (Mongolian prompt hint; 'mn' is not an accepted language code).).

एंडपॉइंट https://api.openai.com/v1/audio/transcriptions. भाषा mn. ऑपरेटिंग पॉइंट gpt-4o-transcribe. वक्ता पृथक्करण none.

डेटासेट: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 नमूने, कुल 1849.3s ऑडियो।

डेटासेट स्रोत लिंक:

मेट्रिक्स: WER और CER मानक शब्द/अक्षर लेवेनश्टाइन संरेखण से, केस व विराम चिह्न पर अनुमापित, गणना किए जाते हैं। सटीकता = 100 − WER। गति गुणांक = ऑडियो अवधि ÷ प्रसंस्करण समय (× रियल-टाइम)। सभी अनुरोध वास्तविक GPT-4o Transcribe Batch API कॉल हैं, कैश या सिम्युलेटेड नहीं।

अंतर हाइलाइटिंग: परिणाम कॉलम आधार सत्य से संरेखित होता है और प्रत्येक प्रतिस्थापन व निवेश को लाल रंग करता है। विलोपन (परिणाम से अनुपस्थित शब्द) परिणाम कॉलम में नहीं दिखाए जाते — अपेक्षित कॉलम पहले से संपूर्ण आधार सत्य यथावत् रखता है।

GPT-4o Transcribe Benchmark Runner द्वारा निर्मित · GPT-4o Transcribe Batch API v2 · चलाना Aug 14, 2026, 4:21 PM