Žebříček převodu mongolské řeči na text
GPT-4o TranscribeOperating point: gpt-4o-transcribe

GPT-4o Transcribe — Benchmark převodu mongolské řeči na text

Skutečné výsledky ze GPT-4o Transcribe Batch API (vylepšený provozní bod, jazyk mn) vyhodnocené na 4 mongolských datasetech a 265 zvukových vzorcích. Každé číslo níže je změřené — ne marketing. WER, rychlost a cena jsou ukázány tak, jak jsou, brutálně poctivě.

Jazyk:MNDiarizace:noneVzorky:265Běh:Aug 14, 2026, 4:21 PMEndpoint:https://api.openai.com/v1/audio/transcriptions
06710047%
Přesnost

265/265 vzorků přepsáno · 100% úspěch

06710053%
Míra chybovosti slov

Nižší je lepší · na 265 vzorcích

Klíčové metriky
Míra chybovosti znaků27.6%
Prům. rychlostní faktor2.11×násobek reálného času
Celkový rychlostní faktor2.11×
Prům. latence na vzorek3.7s
Celkem zpracovaný zvuk1849.3s30.8 min

Cena

Ceník GPT-4o Transcribe pro dávkový přepis. Bez slev a sjednaných sazeb — hrubá sazba za minutu.

Za 1000 minut
$6
dávka
Za minutu
$0.0060
efektivní
Za 1000 min (těchto 30.8 min)
$11.10
by stálo
Open source?
proprietární

Zdroj ceny: veřejné ceny GPT-4o Transcribe. Duudlaga Flow je ukázán pouze pro kontext — tato stránka izoluje GPT-4o Transcribe, aby číslo nebylo nafouknuté naším produktem.

WER a CER podle datasetu

Míry chybovosti slov a znaků podle datasetu. Nižší je lepší — a to jsou skutečná čísla GPT-4o Transcribe, která jsou slabá na Common Voice 24.

Common Voice 24 (MN)
Source dataset →
WER
61.3%
CER
31.1%
Shunya Labs Mongolian Speech
Source dataset →
WER
41.7%
CER
19.4%
Common Voice 20 (MN)
Source dataset →
WER
65.9%
CER
36.4%
Modern Voice
WER
47.4%
CER
25.5%
WERCER

Souhrn datasetů

Agregovaná přesnost, rychlost a časování pro každý dataset.

DatasetSourceVzorkyÚspěchWERCERPřesnostRychlostZvuk (s)Zprac. (s)
Common Voice 24 (MN)Hugging Face →5959/5961.3%31.1%38.7%2.73×330.6s121.2s
Shunya Labs Mongolian SpeechHugging Face →6060/6041.7%19.4%58.3%1.67×645.1s386.8s
Common Voice 20 (MN)Hugging Face →5454/5465.9%36.4%34.1%2.01×269.8s133.9s
Modern Voice9292/9247.4%25.5%52.6%2.59×603.8s233.4s

WER vs. rychlost — na vzorek

Každý bod je jeden zvukový vzorek. Ideální místo je vlevo dole (málo chyb, rychle). GPT-4o Transcribe má vysokou chybovost u mnoha vzorků Common Voice 24.

Výsledky na vzorek

Referenční pravda je ukázána doslova ve sloupci Očekáváno. Sloupec výsledku červeně zvýrazní pouze slova, která GPT-4o Transcribe chybovala — bez přeškrtávání/zámen, jen chyby.

265 řádků
červenáchybné slovo ve výsledkuběžnýsprávně přepsánoSloupec Očekáváno je ukázán doslova jako referenční pravda
#ZvukVzorekDatasetOčekáváno (referenční pravda)Výsledek GPT-4o TranscribeWERCERI/D/S
1btsee_0001Common Voice 24 (MN)Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье.Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж яваагаа хэлье.12.5%6.9%0/0/1
2btsee_0002Common Voice 24 (MN)Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү?Надад сая санагдаж байгаа гэхэд ердөө гурван сарийн хугацаатай байсан л гэж үү?58.3%22.7%1/0/6
3btsee_0003Common Voice 24 (MN)Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе.Одоо би дуртай хүнтэйгээ салахыг хүсч байгаа.85.7%51.9%0/0/6
4btsee_0004Common Voice 24 (MN)Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн.Би бас голдуу хэрээр гэр, хэцэр дээр хийж явдаг хүн.40.0%9.8%0/0/4
5btsee_0005Common Voice 24 (MN)Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ.Хаварын сүүлчээс барлагийн хоёр зоогоор нэргүүл шарив.100.0%66.2%0/3/7
6btsee_0006Common Voice 24 (MN)Алив наашаа ороод ир гээд гэртээ оров.Айсин наашаараад ир, гэж гэртээ оров.57.1%24.3%0/1/3
7btsee_0007Common Voice 24 (MN)Өө өндөр дээдэс таны тухайд би баталж чадахгүй.Оо, өндөртэд таныг тохойод би баталж чадахгүй.62.5%23.9%0/1/4
8btsee_0008Common Voice 24 (MN)Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.Харин 33 дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.12.5%8.9%0/0/1
9btsee_0009Common Voice 24 (MN)Та нар очингуутаа шөл л өгч үз.Та нар орчлонгоудаа шүүлт өгч үз.42.9%30.0%0/1/2
10btsee_0010Common Voice 24 (MN)Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь.Ирүүсөөл үлдүүрээсээ салаагүй явсна юм чинь.57.1%25.0%0/1/3
Stránka 1 z 27

Metodika

Jak byla tato čísla získána.

Poskytovatel: GPT-4o Transcribe (OpenAI gpt-4o-transcribe hosted transcription (Mongolian prompt hint; 'mn' is not an accepted language code).).

Endpoint https://api.openai.com/v1/audio/transcriptions. Jazyk mn. Operating point gpt-4o-transcribe. Diarizace none.

Datasety: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 vzorků, celkem 1849.3s zvuku.

Dataset source URLs:

Metriky: WER a CER se počítají standardním zarovnáním Levenshtein nad slovy/znaky s normalizací velikosti písmen a interpunkce. Přesnost = 100 − WER. Rychlostní faktor = délka zvuku ÷ doba zpracování (× reálný čas). Všechny požadavky jsou skutečná volání Batch API GPT-4o Transcribe, ne z mezipaměti ani simulovaná.

Zvýraznění rozdílů: Sloupec výsledku se zarovnává k referenční pravdě a barví červeně každou substituci a insertci. Delece (slova chybějící ve výsledku) se ve sloupci výsledku nezobrazují — sloupec Očekáváno již obsahuje celou referenční pravdu tak, jak je.

Vygenerováno GPT-4o Transcribe Benchmark Runner · GPT-4o Transcribe Batch API v2 · běh Aug 14, 2026, 4:21 PM