OpenAI Whisper — Penanda aras suara-ke-teks bahasa Mongolia
Keputusan sebenar daripada OpenAI Whisper Batch API (titik operasi dipertingkat, bahasa mn) dinilai ke atas 4 set data bahasa Mongolia dan 265 sampel audio. Setiap nombor di bawah diukur — bukan pemasaran. WER, kelajuan dan harga ditunjukkan apa adanya, jujur tanpa basa-basi.
265/265 sampel ditranskripsi · 100% berjaya
Lebih rendah lebih baik · pada 265 sampel
Harga
Harga senarai OpenAI Whisper untuk transkripsi kelompok. Tanpa diskaun atau kadar yang dirunding — kadar mentah per minit.
Sumber harga: harga awam OpenAI Whisper. Duudlaga Flow ditunjukkan untuk konteks sahaja — halaman ini mengasingkan OpenAI Whisper supaya nombor tidak dibesar-besarkan oleh produk kami.
WER & CER per set data
Kadar ralat perkataan dan aksara per set data. Lebih rendah lebih baik — dan ini nombor sebenar OpenAI Whisper, yang lemah pada Common Voice 24.
Ringkasan set data
Ketepatan, kelajuan dan masa terkumpul bagi setiap set data.
| Set data | Sumber | Sampel | Berjaya | WER | CER | Ketepatan | Kelajuan | Audio (sa) | Proses (sa) |
|---|---|---|---|---|---|---|---|---|---|
| Common Voice 24 (MN) | Hugging Face → | 59 | 59/59 | 104% | 63.4% | -4.0% | 1.95× | 330.6s | 169.5s |
| Shunya Labs Mongolian Speech | Hugging Face → | 60 | 60/60 | 104.1% | 61.3% | -4.1% | 1.39× | 645.1s | 462.7s |
| Common Voice 20 (MN) | Hugging Face → | 54 | 54/54 | 111.6% | 69.7% | -11.6% | 1.96× | 269.8s | 137.6s |
| Modern Voice | — | 92 | 92/92 | 103% | 61.9% | -3.0% | 1.3× | 603.8s | 464.9s |
WER vs kelajuan — per sampel
Setiap titik ialah satu sampel audio. Titik ideal di kiri bawah (ralat kecil, laju). OpenAI Whisper mempunyai ralat tinggi pada banyak sampel Common Voice 24.
Keputusan per sampel
Kebenaran rujukan ditunjukkan apa adanya dalam lajur Dijangka. Lajur hasil menyerlahkan merah hanya perkataan yang OpenAI Whisper silap — tanpa palang/tukar, hanya kesilapan.
| # | Audio | Sampel | Set data | Dijangka (kebenaran rujukan) | Hasil OpenAI Whisper | WER | CER | I/D/S |
|---|---|---|---|---|---|---|---|---|
| 1 | btsee_0001 | Common Voice 24 (MN) | Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье. | Ұлдэ әм сұл ұраңаса омін тәнді мидді джаға ға хелі. | 125.0% | 55.2% | 2/0/8 | |
| 2 | btsee_0002 | Common Voice 24 (MN) | Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү? | Нады дзэйэ санғад джырғал кетегерді Ұрғун сарай ұқыцат табай сіңгіджу. | 100.0% | 58.7% | 0/2/10 | |
| 3 | btsee_0003 | Common Voice 24 (MN) | Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе. | Ұтағди дұрс дұршиң үйгісі салғих джүцүгі. | 100.0% | 73.1% | 0/1/6 | |
| 4 | btsee_0004 | Common Voice 24 (MN) | Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн. | Би бас қалту хэлээр кир үсгээр дирхи джақты қун. | 90.0% | 49.0% | 0/1/8 | |
| 5 | btsee_0005 | Common Voice 24 (MN) | Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ. | Қан құрымас дұғардас бұл түкө бұрауңы ұңы қоҵірд лоңғар нергүр шер ең бұл дзең. | 140.0% | 71.4% | 4/0/10 | |
| 6 | btsee_0006 | Common Voice 24 (MN) | Алив наашаа ороод ир гээд гэртээ оров. | Әлімн әше орадыр, кеткісті орығы. | 100.0% | 67.6% | 0/2/5 | |
| 7 | btsee_0007 | Common Voice 24 (MN) | Өө өндөр дээдэс таны тухайд би баталж чадахгүй. | Ө, өндөрді цітаңи тұқад, бі бақталік жәл тұқғи. | 100.0% | 56.5% | 0/0/8 | |
| 8 | btsee_0008 | Common Voice 24 (MN) | Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв. | Қырын үріптүң ұтаңыз екілің Ұмұс ек сәңұрғы джіңіліу. | 100.0% | 76.8% | 0/0/8 | |
| 9 | btsee_0009 | Common Voice 24 (MN) | Та нар очингуутаа шөл л өгч үз. | Таныр ұчыңғута шүлілд ұқчүд. | 100.0% | 50.0% | 0/3/4 | |
| 10 | btsee_0010 | Common Voice 24 (MN) | Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь. | Еру сөл өлтур өссес әлта өгі өп сөйімчін. | 114.3% | 70.8% | 1/0/7 |
Metodologi
Bagaimana nombor ini diperoleh.
Penyedia: OpenAI Whisper (OpenAI whisper-1 hosted transcription (auto language detection; 'mn' is not an accepted language hint).).
Endpoint https://api.openai.com/v1/audio/transcriptions. Bahasa mn. Titik operasi whisper-1. Pemisahan pentutur none.
Set data: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 sampel, jumlah 1849.3s audio.
- Common Voice 24 (MN)https://huggingface.co/datasets/btsee/common-voices-24-mn
- Shunya Labs Mongolian Speechhttps://huggingface.co/datasets/shunyalabs/mongolian-speech-dataset
- Common Voice 20 (MN)https://huggingface.co/datasets/warmestman/common-voice-20-mn-normalized
- Modern Voice—
Metrik: WER dan CER dikira dengan jajaran Levenshtein perkataan/aksara piawai, dinormalisasi untuk huruf besar/kecil dan tanda baca. Ketepatan = 100 − WER. Faktor kelajuan = tempoh audio ÷ masa pemprosesan (× masa nyata). Semua permintaan ialah panggilan sebenar ke Batch API OpenAI Whisper, bukan cache atau simulasi.
Penyerlahan perbezaan: Lajur hasil dijajar dengan kebenaran rujukan dan mewarnakan merah setiap penggantian dan penyisipan. Pemadaman (perkataan hilang dari hasil) tidak ditunjukkan dalam lajur hasil — lajur Dijangka sudah memuatkan keseluruhan kebenaran rujukan apa adanya.