GPT-4o Transcribe — मंगोलियन स्पीच-टू-टेक्स्ट बेंचमार्क
GPT-4o Transcribe Batch API (सुधारित ऑपरेटिंग पॉईंट, भाषा mn) द्वारे 4 मंगोलियन डेटासेट आणि 265 ऑडिओ नमुन्यांवर मूल्यांकन केलेले वास्तविक निकाल. खालील प्रत्येक संख्या मोजली आहे — मार्केटिंग नाही. WER, वेग आणि किंमत जशी आहे तशी, कठोर प्रामाणिकपणे दाखवली आहे.
265/265 नमुने ट्रान्सक्राइब केले · 100% यश
कमी चांगले · 265 नमुन्यांवर
किंमत
बॅच ट्रान्सक्रिप्शनसाठी GPT-4o Transcribe ची यादी किंमत. कोणतीही सूट किंवा वाटाघाटी केलेली दर नाही — प्रति मिनिट कच्चा दर.
किंमतीचा स्रोत: GPT-4o Transcribe सार्वजनिक किंमत. Duudlaga Flow फक्त संदर्भासाठी दाखवले आहे — हे पृष्ठ GPT-4o Transcribe ला वेगळे करते जेणेकरून संख्या आमच्या उत्पादनाने फुगवली जाणार नाही.
डेटासेट निहाय WER आणि CER
डेटासेट निहाय शब्द आणि अक्षर त्रुटी दर. कमी चांगले — आणि हे GPT-4o Transcribe चे वास्तविक अंक आहेत, जे Common Voice 24 वर दुर्बळ आहेत.
डेटासेट सारांश
प्रत्येक डेटासेटसाठी सातत्याने अचूकता, वेग आणि वेळ.
| डेटासेट | स्रोत | नमुने | यश | WER | CER | अचूकता | वेग | ऑडिओ (से) | प्रक्रि. (से) |
|---|---|---|---|---|---|---|---|---|---|
| Common Voice 24 (MN) | Hugging Face → | 59 | 59/59 | 61.3% | 31.1% | 38.7% | 2.73× | 330.6s | 121.2s |
| Shunya Labs Mongolian Speech | Hugging Face → | 60 | 60/60 | 41.7% | 19.4% | 58.3% | 1.67× | 645.1s | 386.8s |
| Common Voice 20 (MN) | Hugging Face → | 54 | 54/54 | 65.9% | 36.4% | 34.1% | 2.01× | 269.8s | 133.9s |
| Modern Voice | — | 92 | 92/92 | 47.4% | 25.5% | 52.6% | 2.59× | 603.8s | 233.4s |
WER विरुद्ध वेग — नमुना निहाय
प्रत्येक बिंदू एक ऑडिओ नमुना आहे. आदर्श स्थान खाली-डावीकडे (कमी त्रुटी, वेगवान) आहे. GPT-4o Transcribe ला अनेक Common Voice 24 नमुन्यांवर त्रुटी जास्त आहे.
नमुना निहाय निकाल
अपेक्षित स्तंभात ग्राउंड ट्रुथ जसेच्या तसे दाखवले आहे. निकाल स्तंभ फक्त GPT-4o Transcribe ने चूक केलेले शब्द लाल रंगात हायलाइट करतो — कोणतीही स्ट्राइकथ्रू/स्वॅप नाही, फक्त चुका.
| # | ऑडिओ | नमुना | डेटासेट | अपेक्षित (ग्राउंड ट्रुथ) | GPT-4o Transcribe निकाल | WER | CER | I/D/S |
|---|---|---|---|---|---|---|---|---|
| 1 | btsee_0001 | Common Voice 24 (MN) | Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье. | Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж яваагаа хэлье. | 12.5% | 6.9% | 0/0/1 | |
| 2 | btsee_0002 | Common Voice 24 (MN) | Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү? | Надад сая санагдаж байгаа гэхэд ердөө гурван сарийн хугацаатай байсан л гэж үү? | 58.3% | 22.7% | 1/0/6 | |
| 3 | btsee_0003 | Common Voice 24 (MN) | Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе. | Одоо би дуртай хүнтэйгээ салахыг хүсч байгаа. | 85.7% | 51.9% | 0/0/6 | |
| 4 | btsee_0004 | Common Voice 24 (MN) | Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн. | Би бас голдуу хэрээр гэр, хэцэр дээр хийж явдаг хүн. | 40.0% | 9.8% | 0/0/4 | |
| 5 | btsee_0005 | Common Voice 24 (MN) | Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ. | Хаварын сүүлчээс барлагийн хоёр зоогоор нэргүүл шарив. | 100.0% | 66.2% | 0/3/7 | |
| 6 | btsee_0006 | Common Voice 24 (MN) | Алив наашаа ороод ир гээд гэртээ оров. | Айсин наашаараад ир, гэж гэртээ оров. | 57.1% | 24.3% | 0/1/3 | |
| 7 | btsee_0007 | Common Voice 24 (MN) | Өө өндөр дээдэс таны тухайд би баталж чадахгүй. | Оо, өндөртэд таныг тохойод би баталж чадахгүй. | 62.5% | 23.9% | 0/1/4 | |
| 8 | btsee_0008 | Common Voice 24 (MN) | Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв. | Харин 33 дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв. | 12.5% | 8.9% | 0/0/1 | |
| 9 | btsee_0009 | Common Voice 24 (MN) | Та нар очингуутаа шөл л өгч үз. | Та нар орчлонгоудаа шүүлт өгч үз. | 42.9% | 30.0% | 0/1/2 | |
| 10 | btsee_0010 | Common Voice 24 (MN) | Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь. | Ирүүсөөл үлдүүрээсээ салаагүй явсна юм чинь. | 57.1% | 25.0% | 0/1/3 |
पद्धतीशास्त्र
हे अंक कसे मिळवले.
पुरवठादार: GPT-4o Transcribe (OpenAI gpt-4o-transcribe hosted transcription (Mongolian prompt hint; 'mn' is not an accepted language code).).
एंडपॉईंट https://api.openai.com/v1/audio/transcriptions. भाषा mn. ऑपरेटिंग पॉइंट gpt-4o-transcribe. स्पीकर विभाजन none.
डेटासेट: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 नमुने, एकूण 1849.3s ऑडिओ.
- Common Voice 24 (MN)https://huggingface.co/datasets/btsee/common-voices-24-mn
- Shunya Labs Mongolian Speechhttps://huggingface.co/datasets/shunyalabs/mongolian-speech-dataset
- Common Voice 20 (MN)https://huggingface.co/datasets/warmestman/common-voice-20-mn-normalized
- Modern Voice—
मेट्रिक्स: WER आणि CER मानक शब्द/अक्षर लेव्हेनश्टाइन अलायन्समध्ये, केस आणि विरामचिन्हांसाठी नॉर्मलाइझ करून गणना केले जातात. अचूकता = 100 − WER. वेग गुणक = ऑडिओ कालावधी ÷ प्रक्रिया वेळ (× रिअल-टाइम). सर्व विनंत्या वास्तविक GPT-4o Transcribe Batch API कॉल आहेत, कॅशे किंवा सिम्युलेटेड नाहीत.
फरक हायलाइटिंग: निकाल स्तंभ ग्राउंड ट्रुथशी जुळवला जातो आणि प्रत्येक प्रतिस्थापन व समावेश लाल रंगात करतो. विलोपन (निकालातून हरवलेले शब्द) निकाल स्तंभात दाखवले जात नाहीत — अपेक्षित स्तंभ आधीच संपूर्ण ग्राउंड ट्रुथ जसेच्या तसे धरतो.