OpenAI Whisper — Benchmark voor Mongoolse spraak-naar-tekst
Echte resultaten van de OpenAI Whisper Batch API (verbeterd operationeel punt, taal mn), geëvalueerd op 4 Mongoolse datasets en 265 audiosamples. Elk getal hieronder is gemeten — geen marketing. WER, snelheid en prijs worden getoond zoals ze zijn, brutaal eerlijk.
265/265 samples getranscribeerd · 100% succes
Lager is beter · over 265 samples
Prijs
OpenAI Whisper-lijstprijs voor batch-transcriptie. Geen kortingen of onderhandelde tarieven — het ruwe tarief per minuut.
Prijsbron: publieke prijzen van OpenAI Whisper. Duudlaga Flow wordt alleen ter context getoond — deze pagina isoleert OpenAI Whisper zodat het getal niet wordt opgeblazen door ons eigen product.
WER en CER per dataset
Woord- en tekenfoutpercentages per dataset. Lager is beter — en dit zijn de echte OpenAI Whisper-cijfers, die zwak zijn op Common Voice 24.
Overzicht per dataset
Geaggregeerde nauwkeurigheid, snelheid en timing per dataset.
| Dataset | Bron | Monsters | Succes | WER | CER | Nauwkeurigheid | Snelheid | Audio (s) | Verw. (s) |
|---|---|---|---|---|---|---|---|---|---|
| Common Voice 24 (MN) | Hugging Face → | 59 | 59/59 | 104% | 63.4% | -4.0% | 1.95× | 330.6s | 169.5s |
| Shunya Labs Mongolian Speech | Hugging Face → | 60 | 60/60 | 104.1% | 61.3% | -4.1% | 1.39× | 645.1s | 462.7s |
| Common Voice 20 (MN) | Hugging Face → | 54 | 54/54 | 111.6% | 69.7% | -11.6% | 1.96× | 269.8s | 137.6s |
| Modern Voice | — | 92 | 92/92 | 103% | 61.9% | -3.0% | 1.3× | 603.8s | 464.9s |
WER vs. snelheid — per sample
Elke stip is één audiosample. De sweet spot is linksonder (weinig fouten, snel). OpenAI Whisper scoort hoog op fouten bij veel Common Voice 24-samples.
Resultaten per sample
De ground truth wordt ongewijzigd getoond in de kolom Verwacht. De resultaatkolom markeert alleen de woorden die OpenAI Whisper fout had in rood — geen doorhalingen of wissels, alleen de fouten.
| # | Audio | Monster | Dataset | Verwacht (ground truth) | OpenAI Whisper-resultaat | WER | CER | I/D/S |
|---|---|---|---|---|---|---|---|---|
| 1 | btsee_0001 | Common Voice 24 (MN) | Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье. | Ұлдэ әм сұл ұраңаса омін тәнді мидді джаға ға хелі. | 125.0% | 55.2% | 2/0/8 | |
| 2 | btsee_0002 | Common Voice 24 (MN) | Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү? | Нады дзэйэ санғад джырғал кетегерді Ұрғун сарай ұқыцат табай сіңгіджу. | 100.0% | 58.7% | 0/2/10 | |
| 3 | btsee_0003 | Common Voice 24 (MN) | Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе. | Ұтағди дұрс дұршиң үйгісі салғих джүцүгі. | 100.0% | 73.1% | 0/1/6 | |
| 4 | btsee_0004 | Common Voice 24 (MN) | Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн. | Би бас қалту хэлээр кир үсгээр дирхи джақты қун. | 90.0% | 49.0% | 0/1/8 | |
| 5 | btsee_0005 | Common Voice 24 (MN) | Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ. | Қан құрымас дұғардас бұл түкө бұрауңы ұңы қоҵірд лоңғар нергүр шер ең бұл дзең. | 140.0% | 71.4% | 4/0/10 | |
| 6 | btsee_0006 | Common Voice 24 (MN) | Алив наашаа ороод ир гээд гэртээ оров. | Әлімн әше орадыр, кеткісті орығы. | 100.0% | 67.6% | 0/2/5 | |
| 7 | btsee_0007 | Common Voice 24 (MN) | Өө өндөр дээдэс таны тухайд би баталж чадахгүй. | Ө, өндөрді цітаңи тұқад, бі бақталік жәл тұқғи. | 100.0% | 56.5% | 0/0/8 | |
| 8 | btsee_0008 | Common Voice 24 (MN) | Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв. | Қырын үріптүң ұтаңыз екілің Ұмұс ек сәңұрғы джіңіліу. | 100.0% | 76.8% | 0/0/8 | |
| 9 | btsee_0009 | Common Voice 24 (MN) | Та нар очингуутаа шөл л өгч үз. | Таныр ұчыңғута шүлілд ұқчүд. | 100.0% | 50.0% | 0/3/4 | |
| 10 | btsee_0010 | Common Voice 24 (MN) | Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь. | Еру сөл өлтур өссес әлта өгі өп сөйімчін. | 114.3% | 70.8% | 1/0/7 |
Methodologie
Hoe deze getallen zijn verkregen.
Leverancier: OpenAI Whisper (OpenAI whisper-1 hosted transcription (auto language detection; 'mn' is not an accepted language hint).).
Endpoint https://api.openai.com/v1/audio/transcriptions. Taal mn. Werkpunt whisper-1. Diarisatie none.
Datasets: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 samples, in totaal 1849.3s audio.
- Common Voice 24 (MN)https://huggingface.co/datasets/btsee/common-voices-24-mn
- Shunya Labs Mongolian Speechhttps://huggingface.co/datasets/shunyalabs/mongolian-speech-dataset
- Common Voice 20 (MN)https://huggingface.co/datasets/warmestman/common-voice-20-mn-normalized
- Modern Voice—
Metrieken: WER en CER worden berekend met een standaard woord-/teken-Levenshtein-uitlijning, genormaliseerd voor hoofdletters en leestekens. Nauwkeurigheid = 100 − WER. Snelheidsfactor = audioduur ÷ verwerkingstijd (× realtime). Alle verzoeken zijn echte OpenAI Whisper-Batch-API-aanroepen, niet gecached of gesimuleerd.
Verschilmarkering: De resultaatkolom wordt uitgelijnd op de ground truth en kleurt elke substitutie en insertie rood. Deleties (woorden die ontbreken in het resultaat) worden niet in de resultaatkolom getoond — de kolom Verwacht bevat al de volledige ground truth ongewijzigd.