మంగోలియన్ స్పీచ్-టు-టెక్స్ట్ లీడర్‌బోర్డ్
GPT-4o TranscribeOperating point: gpt-4o-transcribe

GPT-4o Transcribe — మంగోలియన్ స్పీచ్-టు-టెక్స్ట్ బెంచ్‌మార్క్

GPT-4o Transcribe Batch API (మెరుగైన ఆపరేటింగ్ పాయింట్, భాష mn) ద్వారా 4 మంగోలియన్ డేటాసెట్‌లు మరియు 265 ఆడియో నమూనాలపై అంచనా వేసిన వాస్తవ ఫలితాలు. కింద ప్రతి సంఖ్య కొలిచినదే — మార్కెటింగ్ కాదు. WER, వేగం మరియు ధర అలాగే, కఠినమైన నిజాయితీతో చూపబడ్డాయి.

భాష:MNస్పీకర్ వేరుచేత:noneనమూనాలు:265నడపు:Aug 14, 2026, 4:21 PMఎండ్‌పాయింట్:https://api.openai.com/v1/audio/transcriptions
06710047%
ఖచ్చితత్వం

265/265 నమూనాలు ట్రాన్స్‌క్రైబ్ అయ్యాయి · 100% విజయం

06710053%
పద పొరపాటు రేటు

తక్కువ మంచిది · 265 నమూనాలపై

ముఖ్య మెట్రిక్స్
అక్షర పొరపాటు రేటు27.6%
సగటు వేగ గుణకం2.11×రియల్-టైమ్ గుణకారం
మొత్తం వేగ గుణకం2.11×
నమూనాకు సగటు ఆలస్యం3.7s
మొత్తం ప్రాసెస్ చేసిన ఆడియో1849.3s30.8 నిమి

ధర

బ్యాచ్ ట్రాన్స్‌క్రిప్షన్ కోసం GPT-4o Transcribe జాబితా ధర. లాభాలు లేవు లేదా చర్చించిన రేట్లు లేవు — నిమిషానికి ముడి రేటు.

1000 నిమిషాలకు
$6
బ్యాచ్
నిమిషానికి
$0.0060
సమర్థవంతం
1000 నిమికి (ఈ 30.8 నిమి)
$11.10
ఖర్చు
ఓపెన్ సోర్స్?
యాజమాన్య

ధర మూలం: GPT-4o Transcribe పబ్లిక్ ధరలు. Duudlaga Flow కేవలం సందర్భం కోసం చూపబడింది — ఈ పేజీ GPT-4o Transcribe ను వేరు చేస్తుంది తద్వారా సంఖ్య మన ఉత్పత్తి ద్వారా పెంచబడదు.

డేటాసెట్ వారీ WER మరియు CER

డేటాసెట్ వారీ పద మరియు అక్షర పొరపాటు రేట్లు. తక్కువ మంచిది — మరియు ఇవి GPT-4o Transcribe యొక్క వాస్తవ సంఖ్యలు, అవి Common Voice 24 పై బలహీనంగా ఉన్నాయి.

Common Voice 24 (MN)
Source dataset →
WER
61.3%
CER
31.1%
Shunya Labs Mongolian Speech
Source dataset →
WER
41.7%
CER
19.4%
Common Voice 20 (MN)
Source dataset →
WER
65.9%
CER
36.4%
Modern Voice
WER
47.4%
CER
25.5%
WERCER

డేటాసెట్ సారాంశం

ప్రతి డేటాసెట్ కోసం సముదాయ ఖచ్చితత్వం, వేగం మరియు సమయం.

డేటాసెట్SourceనమూనాలువిజయంWERCERఖచ్చితత్వంవేగంఆడియో (సె)ప్రాసె. (సె)
Common Voice 24 (MN)Hugging Face →5959/5961.3%31.1%38.7%2.73×330.6s121.2s
Shunya Labs Mongolian SpeechHugging Face →6060/6041.7%19.4%58.3%1.67×645.1s386.8s
Common Voice 20 (MN)Hugging Face →5454/5465.9%36.4%34.1%2.01×269.8s133.9s
Modern Voice9292/9247.4%25.5%52.6%2.59×603.8s233.4s

WER vs వేగం — నమూనా వారీ

ప్రతి బిందువు ఒక ఆడియో నమూనా. సరైన స్థానం కింద-ఎడమ (తక్కువ పొరపాటు, వేగం). GPT-4o Transcribe అనేక Common Voice 24 నమూనాలపై అధిక పొరపాటు కలిగి ఉంది.

నమూనా వారీ ఫలితాలు

అనుకున్న కాలమ్‌లో గ్రౌండ్ ట్రూత్ అలాగే చూపబడింది. ఫలితాల కాలమ్ GPT-4o Transcribe తప్పు చేసిన పదాలను మాత్రమే ఎరుపు రంగులో హైలైట్ చేస్తుంది — స్ట్రైక్‌థ్రూ/మార్పిడి లేదు, కేవలం తప్పులు.

265 వరుసలు
ఎరుపుఫలితంలో తప్పు పదంసాధారణసరైన ట్రాన్స్‌క్రైబ్అనుకున్న కాలమ్ గ్రౌండ్ ట్రూత్‌గా అలాగే చూపబడింది
#ఆడియోనమూనాడేటాసెట్అనుకున్న (గ్రౌండ్ ట్రూత్)GPT-4o Transcribe ఫలితంWERCERI/D/S
1btsee_0001Common Voice 24 (MN)Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье.Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж яваагаа хэлье.12.5%6.9%0/0/1
2btsee_0002Common Voice 24 (MN)Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү?Надад сая санагдаж байгаа гэхэд ердөө гурван сарийн хугацаатай байсан л гэж үү?58.3%22.7%1/0/6
3btsee_0003Common Voice 24 (MN)Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе.Одоо би дуртай хүнтэйгээ салахыг хүсч байгаа.85.7%51.9%0/0/6
4btsee_0004Common Voice 24 (MN)Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн.Би бас голдуу хэрээр гэр, хэцэр дээр хийж явдаг хүн.40.0%9.8%0/0/4
5btsee_0005Common Voice 24 (MN)Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ.Хаварын сүүлчээс барлагийн хоёр зоогоор нэргүүл шарив.100.0%66.2%0/3/7
6btsee_0006Common Voice 24 (MN)Алив наашаа ороод ир гээд гэртээ оров.Айсин наашаараад ир, гэж гэртээ оров.57.1%24.3%0/1/3
7btsee_0007Common Voice 24 (MN)Өө өндөр дээдэс таны тухайд би баталж чадахгүй.Оо, өндөртэд таныг тохойод би баталж чадахгүй.62.5%23.9%0/1/4
8btsee_0008Common Voice 24 (MN)Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.Харин 33 дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.12.5%8.9%0/0/1
9btsee_0009Common Voice 24 (MN)Та нар очингуутаа шөл л өгч үз.Та нар орчлонгоудаа шүүлт өгч үз.42.9%30.0%0/1/2
10btsee_0010Common Voice 24 (MN)Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь.Ирүүсөөл үлдүүрээсээ салаагүй явсна юм чинь.57.1%25.0%0/1/3
పేజీ 1 / 27

పద్ధతిశాస్త్రం

ఈ సంఖ్యలు ఎలా వచ్చాయి.

ప్రొవైడర్: GPT-4o Transcribe (OpenAI gpt-4o-transcribe hosted transcription (Mongolian prompt hint; 'mn' is not an accepted language code).).

ఎండ్‌పాయింట్ https://api.openai.com/v1/audio/transcriptions. భాష mn. Operating point gpt-4o-transcribe. స్పీకర్ వేరుచేత none.

డేటాసెట్‌లు: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 నమూనాలు, మొత్తం 1849.3s ఆడియో.

Dataset source URLs:

మెట్రిక్స్: WER మరియు CER ప్రామాణిక పద/అక్షర లెవెన్‌స్టైన్ అలైన్‌మెంట్‌తో, కేసు మరియు పంక్చుయేషన్‌కు నార్మలైజ్ చేసి లెక్కించబడతాయి. ఖచ్చితత్వం = 100 − WER. వేగ గుణకం = ఆడియో నిడివి ÷ ప్రాసెసింగ్ సమయం (× రియల్-టైమ్). అన్ని అభ్యర్థనలు నిజమైన GPT-4o Transcribe Batch API కాల్‌లు, క్యాషే లేదా సిమ్యులేటెడ్ కావు.

తేడా హైలైటింగ్: ఫలితాల కాలమ్ గ్రౌండ్ ట్రూత్‌తో అలైన్ అవుతుంది మరియు ప్రతి ప్రత్యామ్నాయం మరియు చొప్పింతను ఎరుపు రంగు చేస్తుంది. తొలగింపులు (ఫలితంలో లేని పదాలు) ఫలితాల కాలమ్‌లో చూపబడవు — అనుకున్న కాలమ్ ఇప్పటికే మొత్తం గ్రౌండ్ ట్రూత్‌ను అలాగే కలిగి ఉంది.

GPT-4o Transcribe Benchmark Runner ద్వారా రూపొందించబడింది · GPT-4o Transcribe Batch API v2 · నడిపినది Aug 14, 2026, 4:21 PM