Papan peringkat speech-to-text bahasa Mongol
wav2vec2 XLSR-53 MNTitik operasi: anton-l/wav2vec2-large-xlsr-53-mongolian (CTC) on mps

wav2vec2 XLSR-53 MN — Benchmark speech-to-text bahasa Mongol

Hasil nyata dari wav2vec2 XLSR-53 MN Batch API (titik operasi yang disempurnakan, bahasa mn) yang dievaluasi pada 4 dataset bahasa Mongol dan 265 sampel audio. Setiap angka di bawah diukur — bukan pemasaran. WER, kecepatan, dan harga ditampilkan apa adanya, jujur tanpa basa-basi.

Bahasa:MNDiariasis:noneSampel:265Jalan:Aug 18, 2026, 5:41 PMEndpoint:local (transformers)
06710055%
Akurasi

265/265 sampel ditranskripsi · 100% sukses

06710045%
Tingkat kesalahan kata

Lebih rendah lebih baik · pada 265 sampel

Metrik utama
Tingkat kesalahan karakter16.4%
Faktor kecepatan rata-rata42.32×kelipatan waktu nyata
Faktor kecepatan total42.32×
Latensi rata-rata per sampel0.2s
Total audio diproses1849.3s30.8 mnt

Harga

Harga daftar wav2vec2 XLSR-53 MN untuk transkripsi batch. Tanpa diskon atau tarif yang dinegosiasikan — tarif mentah per menit.

Per 1000 menit
$0
batch
Per menit
$0.0000
efektif
Per 1000 menit (30.8 menit ini)
$0.00
akan biaya
Sumber terbuka?
milik

Sumber harga: harga publik wav2vec2 XLSR-53 MN. Duudlaga Flow ditampilkan hanya untuk konteks — halaman ini mengisolasi wav2vec2 XLSR-53 MN agar angka tidak dibesar-besarkan oleh produk kami.

WER & CER per dataset

Tingkat kesalahan kata dan karakter per dataset. Lebih rendah lebih baik — dan ini angka nyata wav2vec2 XLSR-53 MN, yang lemah di Common Voice 24.

Common Voice 24 (MN)
Dataset sumber →
WER
37.2%
CER
11.4%
Shunya Labs Mongolian Speech
Dataset sumber →
WER
44.6%
CER
15.3%
Common Voice 20 (MN)
Dataset sumber →
WER
31.7%
CER
9.6%
Modern Voice
WER
58%
CER
24.3%
WERCER

Ringkasan dataset

Akurasi, kecepatan, dan waktu agregat untuk tiap dataset.

DatasetSumberSampelSuksesWERCERAkurasiKecepatanAudio (dtk)Proses (dtk)
Common Voice 24 (MN)Hugging Face →5959/5937.2%11.4%62.8%37.32×330.6s8.9s
Shunya Labs Mongolian SpeechHugging Face →6060/6044.6%15.3%55.4%45.18×645.1s14.3s
Common Voice 20 (MN)Hugging Face →5454/5431.7%9.6%68.3%37.72×269.8s7.2s
Modern Voice9292/9258%24.3%42.0%45.1×603.8s13.4s

WER vs kecepatan — per sampel

Setiap titik adalah satu sampel audio. Titik ideal di kiri bawah (sedikit kesalahan, cepat). wav2vec2 XLSR-53 MN punya kesalahan tinggi pada banyak sampel Common Voice 24.

Hasil per sampel

Kebenaran acuan ditampilkan apa adanya di kolom Diharapkan. Kolom hasil menyorot merah hanya kata yang salah oleh wav2vec2 XLSR-53 MN — tanpa coret-ganti, hanya kesalahan.

265 baris
merahkata salah pada hasilbiasaditranskripsi dengan benarKolom Diharapkan ditampilkan apa adanya sebagai kebenaran acuan
#AudioSampelDatasetDiharapkan (kebenaran acuan)Hasil wav2vec2 XLSR-53 MNWERCERI/D/S
1btsee_0001Common Voice 24 (MN)Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье.гэхдээ амьсгал хураахаасаа өмнө танд мэдэж ягаагаа хэлэе25.0%6.9%0/0/2
2btsee_0002Common Voice 24 (MN)Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү?надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж хүү8.3%1.3%0/0/1
3btsee_0003Common Voice 24 (MN)Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе.одоо бид өөрждөө өвчин эмгийдээсээ салахыг хичээцгээ гийдэг57.1%21.2%1/0/3
4btsee_0004Common Voice 24 (MN)Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн.би бол голдуу хээрээр гэр хэчээр дэр хийж явдаг хүн10.0%2.0%0/0/1
5btsee_0005Common Voice 24 (MN)Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ.тав хурамжт уулаж болдоггүй бур вгүн хоёр луугаар нэргүүл хэрэгүлжээ90.0%29.9%0/0/9
6btsee_0006Common Voice 24 (MN)Алив наашаа ороод ир гээд гэртээ оров.алив наашаа оройдр гээд гэртээ оров28.6%8.1%0/1/1
7btsee_0007Common Voice 24 (MN)Өө өндөр дээдэс таны тухайд би баталж чадахгүй.өө өндөр дээд таны тухайд би баталж чадахгүй12.5%4.3%0/0/1
8btsee_0008Common Voice 24 (MN)Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.харин гурав даг удаагаас эхлэх хүмүүсийг сонирхож эхлэв25.0%5.4%0/0/2
9btsee_0009Common Voice 24 (MN)Та нар очингуутаа шөл л өгч үз.та нар очингуутаа шүлэл өгч үз28.6%6.7%0/1/1
10btsee_0010Common Voice 24 (MN)Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь.ерөөсөө л үйлдвэрээсээ салуугүй орсон юм чинь42.9%16.7%0/0/3
Halaman 1 dari 27

Metodologi

Bagaimana angka ini diperoleh.

Penyedia: wav2vec2 XLSR-53 MN (wav2vec2 XLSR-53 fine-tuned on Mongolian Common Voice — by download count the most-used Mongolian-specific open ASR model on the Hub. CTC output, so no punctuation or casing.). Model dengan lencana ini dilatih pada data yang tumpang tindih dengan korpus benchmark (Common Voice Mongolia — 113 dari 173 sampel — atau korpus publik Shunya Labs). Skor pada korpus yang tumpang tindih menjadi tinggi karena hafalan; nilai model ini lewat tabel per dataset di halaman detailnya, terutama korpus yang TIDAK dipakai melatihnya.

Endpoint local (transformers). Bahasa mn. Titik operasi anton-l/wav2vec2-large-xlsr-53-mongolian (CTC) on mps. Diariasis none.

Dataset: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 sampel, total 1849.3s audio.

URL sumber dataset:

Metrik: WER dan CER dihitung dengan perataan Levenshtein kata/karakter standar, dinormalisasi untuk huruf besar/kecil dan tanda baca. Akurasi = 100 − WER. Faktor kecepatan = durasi audio ÷ waktu pemrosesan (× waktu nyata). Semua permintaan adalah panggilan nyata ke Batch API wav2vec2 XLSR-53 MN, bukan cache atau simulasi.

Penyorotan perbedaan: Kolom hasil diratakan ke kebenaran acuan dan mewarnai merah setiap substitusi dan penyisipan. Penghapusan (kata yang hilang dari hasil) tidak ditampilkan di kolom hasil — kolom Diharapkan sudah memuat seluruh kebenaran acuan apa adanya.

Dibuat oleh wav2vec2 XLSR-53 MN Benchmark Runner · wav2vec2 XLSR-53 MN Batch API v2 · dijalankan Aug 18, 2026, 5:41 PM