OpenAI Whisper — Benchmark ng Mongolian speech-to-text
Tunay na resulta mula sa OpenAI Whisper Batch API (pinahusay na operating point, wika mn) na sinuri sa 4 Mongolian na dataset at 265 audio sample. Bawat numero sa ibaba ay sinusukat — hindi marketing. Ang WER, bilis, at presyo ay ipinapakita kung ano talaga, walang paligoy-ligoy na tapat.
265/265 sample na-transcribe · 100% tagumpay
Mas mababa mas mainam · sa 265 sample
Presyo
Presyo sa listahan ng OpenAI Whisper para sa batch transcription. Walang diskonto o negotiated na rate — ang hilaw na rate kada minuto.
Pinagmulan ng presyo: pampublikong presyo ng OpenAI Whisper. Ang Duudlaga Flow ay ipinapakita para sa konteksto lamang — inhihiwalay ng pahinang ito ang OpenAI Whisper para hindi palabasin ang numero ng aming produkto.
WER at CER bawat dataset
Tasa ng error sa salita at karakter bawat dataset. Mas mababa mas mainam — at ito ang tunay na numero ng OpenAI Whisper, na mahina sa Common Voice 24.
Buod ng dataset
Pinagsama-samang katumpakan, bilis, at timing para sa bawat dataset.
| Dataset | Source | Mga sample | Tagumpay | WER | CER | Katumpakan | Bilis | Audio (seg) | Proseso (seg) |
|---|---|---|---|---|---|---|---|---|---|
| Common Voice 24 (MN) | Hugging Face → | 59 | 59/59 | 104% | 63.4% | -4.0% | 1.95× | 330.6s | 169.5s |
| Shunya Labs Mongolian Speech | Hugging Face → | 60 | 60/60 | 104.1% | 61.3% | -4.1% | 1.39× | 645.1s | 462.7s |
| Common Voice 20 (MN) | Hugging Face → | 54 | 54/54 | 111.6% | 69.7% | -11.6% | 1.96× | 269.8s | 137.6s |
| Modern Voice | — | 92 | 92/92 | 103% | 61.9% | -3.0% | 1.3× | 603.8s | 464.9s |
WER laban sa bilis — kada sample
Bawat tuldok ay isang audio sample. Ang ideal na posisyon ay sa kaliwang baba (kaunting error, mabilis). Mataas ang error ng OpenAI Whisper sa maraming sample ng Common Voice 24.
Resulta kada sample
Ang ground truth ay ipinapakang walang pagbabago sa column na Inaasahan. Ang column ng resulta ay naghi-highlight ng pula sa mga salitang nagkamali ang OpenAI Whisper — walang pagstrike/cross-out, mga pagkakamali lamang.
| # | Audio | Sample | Dataset | Inaasahan (ground truth) | Resulta ng OpenAI Whisper | WER | CER | I/D/S |
|---|---|---|---|---|---|---|---|---|
| 1 | btsee_0001 | Common Voice 24 (MN) | Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье. | Ұлдэ әм сұл ұраңаса омін тәнді мидді джаға ға хелі. | 125.0% | 55.2% | 2/0/8 | |
| 2 | btsee_0002 | Common Voice 24 (MN) | Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү? | Нады дзэйэ санғад джырғал кетегерді Ұрғун сарай ұқыцат табай сіңгіджу. | 100.0% | 58.7% | 0/2/10 | |
| 3 | btsee_0003 | Common Voice 24 (MN) | Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе. | Ұтағди дұрс дұршиң үйгісі салғих джүцүгі. | 100.0% | 73.1% | 0/1/6 | |
| 4 | btsee_0004 | Common Voice 24 (MN) | Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн. | Би бас қалту хэлээр кир үсгээр дирхи джақты қун. | 90.0% | 49.0% | 0/1/8 | |
| 5 | btsee_0005 | Common Voice 24 (MN) | Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ. | Қан құрымас дұғардас бұл түкө бұрауңы ұңы қоҵірд лоңғар нергүр шер ең бұл дзең. | 140.0% | 71.4% | 4/0/10 | |
| 6 | btsee_0006 | Common Voice 24 (MN) | Алив наашаа ороод ир гээд гэртээ оров. | Әлімн әше орадыр, кеткісті орығы. | 100.0% | 67.6% | 0/2/5 | |
| 7 | btsee_0007 | Common Voice 24 (MN) | Өө өндөр дээдэс таны тухайд би баталж чадахгүй. | Ө, өндөрді цітаңи тұқад, бі бақталік жәл тұқғи. | 100.0% | 56.5% | 0/0/8 | |
| 8 | btsee_0008 | Common Voice 24 (MN) | Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв. | Қырын үріптүң ұтаңыз екілің Ұмұс ек сәңұрғы джіңіліу. | 100.0% | 76.8% | 0/0/8 | |
| 9 | btsee_0009 | Common Voice 24 (MN) | Та нар очингуутаа шөл л өгч үз. | Таныр ұчыңғута шүлілд ұқчүд. | 100.0% | 50.0% | 0/3/4 | |
| 10 | btsee_0010 | Common Voice 24 (MN) | Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь. | Еру сөл өлтур өссес әлта өгі өп сөйімчін. | 114.3% | 70.8% | 1/0/7 |
Metodolohiya
Paano nakuha ang mga numerong ito.
Provider: OpenAI Whisper (OpenAI whisper-1 hosted transcription (auto language detection; 'mn' is not an accepted language hint).).
Endpoint https://api.openai.com/v1/audio/transcriptions. Wika mn. Operating point whisper-1. Diarisasyon none.
Mga dataset: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 sample, kabuuang 1849.3s audio.
- Common Voice 24 (MN)https://huggingface.co/datasets/btsee/common-voices-24-mn
- Shunya Labs Mongolian Speechhttps://huggingface.co/datasets/shunyalabs/mongolian-speech-dataset
- Common Voice 20 (MN)https://huggingface.co/datasets/warmestman/common-voice-20-mn-normalized
- Modern Voice—
Metrics: Ang WER at CER ay kinakwenta gamit ang standard na salita/karakter na Levenshtein alignment, na-normalize para sa case at punctuation. Katumpakan = 100 − WER. Factor ng bilis = duration ng audio ÷ processing time (× real-time). Lahat ng request ay tunay na tawag sa Batch API ng OpenAI Whisper, hindi cached o simulated.
Pag-highlight ng pagkakaiba: Ang column ng resulta ay ini-align sa ground truth at nagkokolor ng pula sa bawat substitution at insertion. Ang deletions (mga salitang nawawala sa resulta) ay hindi ipinapakita sa column ng resulta — ang column na Inaasahan ay may hawak na ng buong ground truth na walang pagbabago.