मंगोलियन स्पीच-टू-टेक्स्ट लीडरबोर्ड
GPT-4o Transcribeऑपरेटिंग पॉइंट: gpt-4o-transcribe

GPT-4o Transcribe — मंगोलियन स्पीच-टू-टेक्स्ट बेंचमार्क

GPT-4o Transcribe Batch API (सुधारित ऑपरेटिंग पॉईंट, भाषा mn) द्वारे 4 मंगोलियन डेटासेट आणि 265 ऑडिओ नमुन्यांवर मूल्यांकन केलेले वास्तविक निकाल. खालील प्रत्येक संख्या मोजली आहे — मार्केटिंग नाही. WER, वेग आणि किंमत जशी आहे तशी, कठोर प्रामाणिकपणे दाखवली आहे.

भाषा:MNस्पीकर विभाजन:noneनमुने:265चालवा:Aug 14, 2026, 4:21 PMएंडपॉईंट:https://api.openai.com/v1/audio/transcriptions
06710047%
अचूकता

265/265 नमुने ट्रान्सक्राइब केले · 100% यश

06710053%
शब्द त्रुटी दर

कमी चांगले · 265 नमुन्यांवर

मुख्य मेट्रिक्स
अक्षर त्रुटी दर27.6%
सरासरी वेग गुणक2.11×रिअल-टाइम गुणक
एकूण वेग गुणक2.11×
नमुन्यामागे सरासरी विलंब3.7s
एकूण प्रक्रिया केलेले ऑडिओ1849.3s30.8 मिनिटे

किंमत

बॅच ट्रान्सक्रिप्शनसाठी GPT-4o Transcribe ची यादी किंमत. कोणतीही सूट किंवा वाटाघाटी केलेली दर नाही — प्रति मिनिट कच्चा दर.

प्रति 1000 मिनिटे
$6
बॅच
प्रति मिनित
$0.0060
प्रभावी
प्रति 1000 मिनिटे (ही 30.8 मिनिटे)
$11.10
खर्च
ओपन सोर्स?
मालकीचे

किंमतीचा स्रोत: GPT-4o Transcribe सार्वजनिक किंमत. Duudlaga Flow फक्त संदर्भासाठी दाखवले आहे — हे पृष्ठ GPT-4o Transcribe ला वेगळे करते जेणेकरून संख्या आमच्या उत्पादनाने फुगवली जाणार नाही.

डेटासेट निहाय WER आणि CER

डेटासेट निहाय शब्द आणि अक्षर त्रुटी दर. कमी चांगले — आणि हे GPT-4o Transcribe चे वास्तविक अंक आहेत, जे Common Voice 24 वर दुर्बळ आहेत.

WER
61.3%
CER
31.1%
Shunya Labs Mongolian Speech
स्रोत डेटासेट →
WER
41.7%
CER
19.4%
WER
65.9%
CER
36.4%
Modern Voice
WER
47.4%
CER
25.5%
WERCER

डेटासेट सारांश

प्रत्येक डेटासेटसाठी सातत्याने अचूकता, वेग आणि वेळ.

डेटासेटस्रोतनमुनेयशWERCERअचूकतावेगऑडिओ (से)प्रक्रि. (से)
Common Voice 24 (MN)Hugging Face →5959/5961.3%31.1%38.7%2.73×330.6s121.2s
Shunya Labs Mongolian SpeechHugging Face →6060/6041.7%19.4%58.3%1.67×645.1s386.8s
Common Voice 20 (MN)Hugging Face →5454/5465.9%36.4%34.1%2.01×269.8s133.9s
Modern Voice9292/9247.4%25.5%52.6%2.59×603.8s233.4s

WER विरुद्ध वेग — नमुना निहाय

प्रत्येक बिंदू एक ऑडिओ नमुना आहे. आदर्श स्थान खाली-डावीकडे (कमी त्रुटी, वेगवान) आहे. GPT-4o Transcribe ला अनेक Common Voice 24 नमुन्यांवर त्रुटी जास्त आहे.

नमुना निहाय निकाल

अपेक्षित स्तंभात ग्राउंड ट्रुथ जसेच्या तसे दाखवले आहे. निकाल स्तंभ फक्त GPT-4o Transcribe ने चूक केलेले शब्द लाल रंगात हायलाइट करतो — कोणतीही स्ट्राइकथ्रू/स्वॅप नाही, फक्त चुका.

265 पंक्ती
लालनिकालातील चुकीचा शब्दसाधेअचूक ट्रान्सक्राइब केलेअपेक्षित स्तंभ ग्राउंड ट्रुथ म्हणून जसेच्या तसे दाखवला आहे
#ऑडिओनमुनाडेटासेटअपेक्षित (ग्राउंड ट्रुथ)GPT-4o Transcribe निकालWERCERI/D/S
1btsee_0001Common Voice 24 (MN)Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье.Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж яваагаа хэлье.12.5%6.9%0/0/1
2btsee_0002Common Voice 24 (MN)Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү?Надад сая санагдаж байгаа гэхэд ердөө гурван сарийн хугацаатай байсан л гэж үү?58.3%22.7%1/0/6
3btsee_0003Common Voice 24 (MN)Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе.Одоо би дуртай хүнтэйгээ салахыг хүсч байгаа.85.7%51.9%0/0/6
4btsee_0004Common Voice 24 (MN)Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн.Би бас голдуу хэрээр гэр, хэцэр дээр хийж явдаг хүн.40.0%9.8%0/0/4
5btsee_0005Common Voice 24 (MN)Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ.Хаварын сүүлчээс барлагийн хоёр зоогоор нэргүүл шарив.100.0%66.2%0/3/7
6btsee_0006Common Voice 24 (MN)Алив наашаа ороод ир гээд гэртээ оров.Айсин наашаараад ир, гэж гэртээ оров.57.1%24.3%0/1/3
7btsee_0007Common Voice 24 (MN)Өө өндөр дээдэс таны тухайд би баталж чадахгүй.Оо, өндөртэд таныг тохойод би баталж чадахгүй.62.5%23.9%0/1/4
8btsee_0008Common Voice 24 (MN)Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.Харин 33 дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.12.5%8.9%0/0/1
9btsee_0009Common Voice 24 (MN)Та нар очингуутаа шөл л өгч үз.Та нар орчлонгоудаа шүүлт өгч үз.42.9%30.0%0/1/2
10btsee_0010Common Voice 24 (MN)Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь.Ирүүсөөл үлдүүрээсээ салаагүй явсна юм чинь.57.1%25.0%0/1/3
पृष्ठ 1 / 27

पद्धतीशास्त्र

हे अंक कसे मिळवले.

पुरवठादार: GPT-4o Transcribe (OpenAI gpt-4o-transcribe hosted transcription (Mongolian prompt hint; 'mn' is not an accepted language code).).

एंडपॉईंट https://api.openai.com/v1/audio/transcriptions. भाषा mn. ऑपरेटिंग पॉइंट gpt-4o-transcribe. स्पीकर विभाजन none.

डेटासेट: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 नमुने, एकूण 1849.3s ऑडिओ.

डेटासेट स्रोत दुवे:

मेट्रिक्स: WER आणि CER मानक शब्द/अक्षर लेव्हेनश्टाइन अलायन्समध्ये, केस आणि विरामचिन्हांसाठी नॉर्मलाइझ करून गणना केले जातात. अचूकता = 100 − WER. वेग गुणक = ऑडिओ कालावधी ÷ प्रक्रिया वेळ (× रिअल-टाइम). सर्व विनंत्या वास्तविक GPT-4o Transcribe Batch API कॉल आहेत, कॅशे किंवा सिम्युलेटेड नाहीत.

फरक हायलाइटिंग: निकाल स्तंभ ग्राउंड ट्रुथशी जुळवला जातो आणि प्रत्येक प्रतिस्थापन व समावेश लाल रंगात करतो. विलोपन (निकालातून हरवलेले शब्द) निकाल स्तंभात दाखवले जात नाहीत — अपेक्षित स्तंभ आधीच संपूर्ण ग्राउंड ट्रुथ जसेच्या तसे धरतो.

GPT-4o Transcribe Benchmark Runner द्वारे तयार · GPT-4o Transcribe Batch API v2 · चालवले Aug 14, 2026, 4:21 PM