OmniASR LLM-1B — Benchmark speech-to-text bahasa Mongol
Hasil nyata dari OmniASR LLM-1B Batch API (titik operasi yang disempurnakan, bahasa mn) yang dievaluasi pada 4 dataset bahasa Mongol dan 265 sampel audio. Setiap angka di bawah diukur — bukan pemasaran. WER, kecepatan, dan harga ditampilkan apa adanya, jujur tanpa basa-basi.
265/265 sampel ditranskripsi · 100% sukses
Lebih rendah lebih baik · pada 265 sampel
Harga
Harga daftar OmniASR LLM-1B untuk transkripsi batch. Tanpa diskon atau tarif yang dinegosiasikan — tarif mentah per menit.
Sumber harga: harga publik OmniASR LLM-1B. Duudlaga Flow ditampilkan hanya untuk konteks — halaman ini mengisolasi OmniASR LLM-1B agar angka tidak dibesar-besarkan oleh produk kami.
WER & CER per dataset
Tingkat kesalahan kata dan karakter per dataset. Lebih rendah lebih baik — dan ini angka nyata OmniASR LLM-1B, yang lemah di Common Voice 24.
Ringkasan dataset
Akurasi, kecepatan, dan waktu agregat untuk tiap dataset.
| Dataset | Sumber | Sampel | Sukses | WER | CER | Akurasi | Kecepatan | Audio (dtk) | Proses (dtk) |
|---|---|---|---|---|---|---|---|---|---|
| Common Voice 24 (MN) | Hugging Face → | 59 | 59/59 | 36.6% | 15.5% | 63.4% | 0.3× | 330.6s | 1088.7s |
| Shunya Labs Mongolian Speech | Hugging Face → | 60 | 60/60 | 22.9% | 6.9% | 77.1% | 0.25× | 645.1s | 2583.1s |
| Common Voice 20 (MN) | Hugging Face → | 54 | 54/54 | 37.2% | 18% | 62.8% | 0.29× | 269.8s | 931.7s |
| Modern Voice | — | 92 | 92/92 | 36.9% | 15.8% | 63.1% | 0.26× | 603.8s | 2304.1s |
WER vs kecepatan — per sampel
Setiap titik adalah satu sampel audio. Titik ideal di kiri bawah (sedikit kesalahan, cepat). OmniASR LLM-1B punya kesalahan tinggi pada banyak sampel Common Voice 24.
Hasil per sampel
Kebenaran acuan ditampilkan apa adanya di kolom Diharapkan. Kolom hasil menyorot merah hanya kata yang salah oleh OmniASR LLM-1B — tanpa coret-ganti, hanya kesalahan.
| # | Audio | Sampel | Dataset | Diharapkan (kebenaran acuan) | Hasil OmniASR LLM-1B | WER | CER | I/D/S |
|---|---|---|---|---|---|---|---|---|
| 1 | btsee_0001 | Common Voice 24 (MN) | Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье. | гэхдээ амьсгал хураахаасаа өмнө танд мэдэж айгаагаа хэлье | 12.5% | 1.7% | 0/0/1 | |
| 2 | btsee_0002 | Common Voice 24 (MN) | Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү? | და́დ წე́ი სა́ნათ ჭირალო̆ გე́ტდეგერ და ყო́რუხ უ̂ნ სარენ ხო́ხ წათდა́ ბჵაჲსნი̆ გეჩუ́ჲნი̆ | 108.3% | 104.0% | 1/0/12 | |
| 3 | btsee_0003 | Common Voice 24 (MN) | Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе. | одоо бид өөрсдөө өвчин эмгэгээсээ салахыг ч хэвцгээв | 28.6% | 9.6% | 1/0/1 | |
| 4 | btsee_0004 | Common Voice 24 (MN) | Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн. | би бол голдуу хээрээр гэр хэцээр дэр хийж явдаг хүн | 0.0% | 0.0% | 0/0/0 | |
| 5 | btsee_0005 | Common Voice 24 (MN) | Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ. | хан хурамч дуурлаж болдохгүй бор өгнө хоёр луугаар нэргүүлэхээр явуулжээ | 70.0% | 18.2% | 0/0/7 | |
| 6 | btsee_0006 | Common Voice 24 (MN) | Алив наашаа ороод ир гээд гэртээ оров. | алив нашаа ороодор гээд гэртээ оров | 42.9% | 8.1% | 0/1/2 | |
| 7 | btsee_0007 | Common Voice 24 (MN) | Өө өндөр дээдэс таны тухайд би баталж чадахгүй. | өө өндөр дээд таны тухайд би ботолж чадахгүй | 25.0% | 8.7% | 0/0/2 | |
| 8 | btsee_0008 | Common Voice 24 (MN) | Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв. | харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв | 0.0% | 0.0% | 0/0/0 | |
| 9 | btsee_0009 | Common Voice 24 (MN) | Та нар очингуутаа шөл л өгч үз. | та нар очингуутаа шүлэл өгч үз | 28.6% | 6.7% | 0/1/1 | |
| 10 | btsee_0010 | Common Voice 24 (MN) | Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь. | эрөөсөө л үйлдвэрээсээ салуугүй явсан юм чинь | 42.9% | 12.5% | 0/0/3 |
Metodologi
Bagaimana angka ini diperoleh.
Penyedia: OmniASR LLM-1B (Meta Omnilingual ASR (omniASR_LLM_1B_v2) run locally — 1,600+ languages, decoding Halh Mongolian (khk_Cyrl).).
Endpoint local (omnilingual-asr). Bahasa mn. Titik operasi omniASR_LLM_1B_v2 (lang=khk_Cyrl). Diariasis none.
Dataset: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 sampel, total 1849.3s audio.
- Common Voice 24 (MN)https://huggingface.co/datasets/btsee/common-voices-24-mn
- Shunya Labs Mongolian Speechhttps://huggingface.co/datasets/shunyalabs/mongolian-speech-dataset
- Common Voice 20 (MN)https://huggingface.co/datasets/warmestman/common-voice-20-mn-normalized
- Modern Voice—
Metrik: WER dan CER dihitung dengan perataan Levenshtein kata/karakter standar, dinormalisasi untuk huruf besar/kecil dan tanda baca. Akurasi = 100 − WER. Faktor kecepatan = durasi audio ÷ waktu pemrosesan (× waktu nyata). Semua permintaan adalah panggilan nyata ke Batch API OmniASR LLM-1B, bukan cache atau simulasi.
Penyorotan perbedaan: Kolom hasil diratakan ke kebenaran acuan dan mewarnai merah setiap substitusi dan penyisipan. Penghapusan (kata yang hilang dari hasil) tidak ditampilkan di kolom hasil — kolom Diharapkan sudah memuat seluruh kebenaran acuan apa adanya.