Papan peringkat suara-ke-teks bahasa Mongolia
wav2vec2 XLSR-53 MNTitik operasi: anton-l/wav2vec2-large-xlsr-53-mongolian (CTC) on mps

wav2vec2 XLSR-53 MN — Penanda aras suara-ke-teks bahasa Mongolia

Keputusan sebenar daripada wav2vec2 XLSR-53 MN Batch API (titik operasi dipertingkat, bahasa mn) dinilai ke atas 4 set data bahasa Mongolia dan 265 sampel audio. Setiap nombor di bawah diukur — bukan pemasaran. WER, kelajuan dan harga ditunjukkan apa adanya, jujur tanpa basa-basi.

Bahasa:MNPemisahan pentutur:noneSampel:265Jalanan:Aug 18, 2026, 5:41 PMEndpoint:local (transformers)
06710055%
Ketepatan

265/265 sampel ditranskripsi · 100% berjaya

06710045%
Kadar ralat perkataan

Lebih rendah lebih baik · pada 265 sampel

Metrik utama
Kadar ralat aksara16.4%
Faktor kelajuan purata42.32×gandaan masa nyata
Faktor kelajuan keseluruhan42.32×
Kependaman purata per sampel0.2s
Jumlah audio diproses1849.3s30.8 min

Harga

Harga senarai wav2vec2 XLSR-53 MN untuk transkripsi kelompok. Tanpa diskaun atau kadar yang dirunding — kadar mentah per minit.

Setiap 1000 minit
$0
kelompok
Setiap minit
$0.0000
berkesan
Setiap 1000 minit (30.8 minit ini)
$0.00
akan kos
Sumber terbuka?
milik

Sumber harga: harga awam wav2vec2 XLSR-53 MN. Duudlaga Flow ditunjukkan untuk konteks sahaja — halaman ini mengasingkan wav2vec2 XLSR-53 MN supaya nombor tidak dibesar-besarkan oleh produk kami.

WER & CER per set data

Kadar ralat perkataan dan aksara per set data. Lebih rendah lebih baik — dan ini nombor sebenar wav2vec2 XLSR-53 MN, yang lemah pada Common Voice 24.

Common Voice 24 (MN)
Set data sumber →
WER
37.2%
CER
11.4%
Shunya Labs Mongolian Speech
Set data sumber →
WER
44.6%
CER
15.3%
Common Voice 20 (MN)
Set data sumber →
WER
31.7%
CER
9.6%
Modern Voice
WER
58%
CER
24.3%
WERCER

Ringkasan set data

Ketepatan, kelajuan dan masa terkumpul bagi setiap set data.

Set dataSumberSampelBerjayaWERCERKetepatanKelajuanAudio (sa)Proses (sa)
Common Voice 24 (MN)Hugging Face →5959/5937.2%11.4%62.8%37.32×330.6s8.9s
Shunya Labs Mongolian SpeechHugging Face →6060/6044.6%15.3%55.4%45.18×645.1s14.3s
Common Voice 20 (MN)Hugging Face →5454/5431.7%9.6%68.3%37.72×269.8s7.2s
Modern Voice9292/9258%24.3%42.0%45.1×603.8s13.4s

WER vs kelajuan — per sampel

Setiap titik ialah satu sampel audio. Titik ideal di kiri bawah (ralat kecil, laju). wav2vec2 XLSR-53 MN mempunyai ralat tinggi pada banyak sampel Common Voice 24.

Keputusan per sampel

Kebenaran rujukan ditunjukkan apa adanya dalam lajur Dijangka. Lajur hasil menyerlahkan merah hanya perkataan yang wav2vec2 XLSR-53 MN silap — tanpa palang/tukar, hanya kesilapan.

265 baris
merahperkataan salah dalam hasilbiasaditranskripsi dengan betulLajur Dijangka ditunjukkan apa adanya sebagai kebenaran rujukan
#AudioSampelSet dataDijangka (kebenaran rujukan)Hasil wav2vec2 XLSR-53 MNWERCERI/D/S
1btsee_0001Common Voice 24 (MN)Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье.гэхдээ амьсгал хураахаасаа өмнө танд мэдэж ягаагаа хэлэе25.0%6.9%0/0/2
2btsee_0002Common Voice 24 (MN)Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү?надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж хүү8.3%1.3%0/0/1
3btsee_0003Common Voice 24 (MN)Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе.одоо бид өөрждөө өвчин эмгийдээсээ салахыг хичээцгээ гийдэг57.1%21.2%1/0/3
4btsee_0004Common Voice 24 (MN)Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн.би бол голдуу хээрээр гэр хэчээр дэр хийж явдаг хүн10.0%2.0%0/0/1
5btsee_0005Common Voice 24 (MN)Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ.тав хурамжт уулаж болдоггүй бур вгүн хоёр луугаар нэргүүл хэрэгүлжээ90.0%29.9%0/0/9
6btsee_0006Common Voice 24 (MN)Алив наашаа ороод ир гээд гэртээ оров.алив наашаа оройдр гээд гэртээ оров28.6%8.1%0/1/1
7btsee_0007Common Voice 24 (MN)Өө өндөр дээдэс таны тухайд би баталж чадахгүй.өө өндөр дээд таны тухайд би баталж чадахгүй12.5%4.3%0/0/1
8btsee_0008Common Voice 24 (MN)Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.харин гурав даг удаагаас эхлэх хүмүүсийг сонирхож эхлэв25.0%5.4%0/0/2
9btsee_0009Common Voice 24 (MN)Та нар очингуутаа шөл л өгч үз.та нар очингуутаа шүлэл өгч үз28.6%6.7%0/1/1
10btsee_0010Common Voice 24 (MN)Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь.ерөөсөө л үйлдвэрээсээ салуугүй орсон юм чинь42.9%16.7%0/0/3
Halaman 1 daripada 27

Metodologi

Bagaimana nombor ini diperoleh.

Penyedia: wav2vec2 XLSR-53 MN (wav2vec2 XLSR-53 fine-tuned on Mongolian Common Voice — by download count the most-used Mongolian-specific open ASR model on the Hub. CTC output, so no punctuation or casing.). Model dengan lencana ini dilatih pada data yang bertindih dengan korpus penanda aras (Common Voice Mongolia — 113 daripada 173 sampel — atau korpus awam Shunya Labs). Skor pada korpus yang bertindih menjadi tinggi kerana hafalan; nilaikan model ini melalui jadual setiap set data di halaman butirannya, terutamanya korpus yang TIDAK digunakan untuk melatihnya.

Endpoint local (transformers). Bahasa mn. Titik operasi anton-l/wav2vec2-large-xlsr-53-mongolian (CTC) on mps. Pemisahan pentutur none.

Set data: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 sampel, jumlah 1849.3s audio.

URL sumber set data:

Metrik: WER dan CER dikira dengan jajaran Levenshtein perkataan/aksara piawai, dinormalisasi untuk huruf besar/kecil dan tanda baca. Ketepatan = 100 − WER. Faktor kelajuan = tempoh audio ÷ masa pemprosesan (× masa nyata). Semua permintaan ialah panggilan sebenar ke Batch API wav2vec2 XLSR-53 MN, bukan cache atau simulasi.

Penyerlahan perbezaan: Lajur hasil dijajar dengan kebenaran rujukan dan mewarnakan merah setiap penggantian dan penyisipan. Pemadaman (perkataan hilang dari hasil) tidak ditunjukkan dalam lajur hasil — lajur Dijangka sudah memuatkan keseluruhan kebenaran rujukan apa adanya.

Dijana oleh wav2vec2 XLSR-53 MN Benchmark Runner · wav2vec2 XLSR-53 MN Batch API v2 · dijalankan Aug 18, 2026, 5:41 PM