Classement de reconnaissance vocale en mongol
wav2vec2 XLSR-53 MNPoint de fonctionnement: anton-l/wav2vec2-large-xlsr-53-mongolian (CTC) on mps

wav2vec2 XLSR-53 MN — Benchmark de reconnaissance vocale en mongol

Résultats réels de la wav2vec2 XLSR-53 MN Batch API (point de fonctionnement avancé, langue mn) évalués sur 4 jeux de données mongols et 265 échantillons audio. Tous les chiffres ci-dessous sont mesurés, pas du marketing. Le WER, la vitesse et le prix sont affichés tels quels, brutalement honnêtes.

Langue:MNDiariatisation:noneÉchantillons:265Exécution:Aug 18, 2026, 5:41 PMEndpoint:local (transformers)
06710055%
Précision

265/265 échantillons transcrits · 100 % de réussite

06710045%
Taux d'erreur par mot

Plus bas c'est mieux · sur 265 échantillons

Métriques principales
Taux d'erreur par caractère16.4%
Facteur de vitesse moyen42.32×multiple du temps réel
Facteur de vitesse total42.32×
Latence moyenne par échantillon0.2s
Audio total traité1849.3s30.8 min

Tarification

Tarif public wav2vec2 XLSR-53 MN pour la transcription par lot. Aucune remise ni tarif négocié — le tarif brut par minute.

Pour 1000 minutes
$0
lot
Par minute
$0.0000
effectif
Pour 1000 min (ces 30.8 min)
$0.00
coûterait
Open source ?
propriétaire

Source du prix : tarification publique de wav2vec2 XLSR-53 MN. Duudlaga Flow est affiché pour contexte uniquement — cette page isole wav2vec2 XLSR-53 MN pour que le chiffre ne soit pas gonflé par notre produit.

WER et CER par jeu de données

Taux d'erreur par mot et par caractère pour chaque jeu de données. Plus bas c'est mieux — et ce sont les vrais chiffres de wav2vec2 XLSR-53 MN, qui sont faibles sur Common Voice 24.

Common Voice 24 (MN)
Jeu de données source →
WER
37.2%
CER
11.4%
Shunya Labs Mongolian Speech
Jeu de données source →
WER
44.6%
CER
15.3%
Common Voice 20 (MN)
Jeu de données source →
WER
31.7%
CER
9.6%
Modern Voice
WER
58%
CER
24.3%
WERCER

Résumé par jeu de données

Précision, vitesse et temps agrégés pour chaque jeu de données.

Jeu de donnéesSourceÉchantillonsRéussiteWERCERPrécisionVitesseAudio (s)Trait. (s)
Common Voice 24 (MN)Hugging Face →5959/5937.2%11.4%62.8%37.32×330.6s8.9s
Shunya Labs Mongolian SpeechHugging Face →6060/6044.6%15.3%55.4%45.18×645.1s14.3s
Common Voice 20 (MN)Hugging Face →5454/5431.7%9.6%68.3%37.72×269.8s7.2s
Modern Voice9292/9258%24.3%42.0%45.1×603.8s13.4s

WER vs vitesse — par échantillon

Chaque point est un échantillon audio. L'idéal est en bas à gauche (peu d'erreurs, rapide). wav2vec2 XLSR-53 MN a un taux d'erreur élevé sur de nombreux échantillons Common Voice 24.

Résultats par échantillon

La vérité terrain est affichée telle quelle dans la colonne Attendu. La colonne de résultat surligne en rouge uniquement les mots que wav2vec2 XLSR-53 MN a ratés — pas de ratures ni d'échanges, juste les erreurs.

265 lignes
rougemot erroné dans le résultatnormaltranscrit correctementLa colonne Attendu est affichée telle quelle comme vérité terrain
#AudioÉchantillonJeu de donnéesAttendu (vérité terrain)Résultat wav2vec2 XLSR-53 MNWERCERI/D/S
1btsee_0001Common Voice 24 (MN)Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье.гэхдээ амьсгал хураахаасаа өмнө танд мэдэж ягаагаа хэлэе25.0%6.9%0/0/2
2btsee_0002Common Voice 24 (MN)Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү?надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж хүү8.3%1.3%0/0/1
3btsee_0003Common Voice 24 (MN)Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе.одоо бид өөрждөө өвчин эмгийдээсээ салахыг хичээцгээ гийдэг57.1%21.2%1/0/3
4btsee_0004Common Voice 24 (MN)Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн.би бол голдуу хээрээр гэр хэчээр дэр хийж явдаг хүн10.0%2.0%0/0/1
5btsee_0005Common Voice 24 (MN)Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ.тав хурамжт уулаж болдоггүй бур вгүн хоёр луугаар нэргүүл хэрэгүлжээ90.0%29.9%0/0/9
6btsee_0006Common Voice 24 (MN)Алив наашаа ороод ир гээд гэртээ оров.алив наашаа оройдр гээд гэртээ оров28.6%8.1%0/1/1
7btsee_0007Common Voice 24 (MN)Өө өндөр дээдэс таны тухайд би баталж чадахгүй.өө өндөр дээд таны тухайд би баталж чадахгүй12.5%4.3%0/0/1
8btsee_0008Common Voice 24 (MN)Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.харин гурав даг удаагаас эхлэх хүмүүсийг сонирхож эхлэв25.0%5.4%0/0/2
9btsee_0009Common Voice 24 (MN)Та нар очингуутаа шөл л өгч үз.та нар очингуутаа шүлэл өгч үз28.6%6.7%0/1/1
10btsee_0010Common Voice 24 (MN)Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь.ерөөсөө л үйлдвэрээсээ салуугүй орсон юм чинь42.9%16.7%0/0/3
Page 1 sur 27

Méthodologie

Comment ces chiffres ont été obtenus.

Fournisseur : wav2vec2 XLSR-53 MN (wav2vec2 XLSR-53 fine-tuned on Mongolian Common Voice — by download count the most-used Mongolian-specific open ASR model on the Hub. CTC output, so no punctuation or casing.). Les modèles portant ce badge ont été entraînés sur des données qui recoupent les corpus du benchmark (Common Voice en mongol — 113 échantillons sur 173 — ou le corpus public de Shunya Labs). Les scores sur les corpus recoupés sont gonflés par la mémorisation ; jugez ces modèles sur le tableau par jeu de données de leur page de détails, en particulier sur les corpus sur lesquels ils n'ont PAS été entraînés.

Endpoint local (transformers). Langue mn. Point de fonctionnement anton-l/wav2vec2-large-xlsr-53-mongolian (CTC) on mps. Diariatisation none.

Jeux de données : Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 échantillons, 1849.3s d'audio au total.

URL sources des jeux de données :

Métriques : WER et CER sont calculés avec un alignement Levenshtein mots/caractères standard, normalisé sur la casse et la ponctuation. Précision = 100 − WER. Facteur de vitesse = durée audio ÷ temps de traitement (× temps réel). Toutes les requêtes sont de vrais appels à la Batch API de wav2vec2 XLSR-53 MN, ni en cache ni simulés.

Surlignage des différences : La colonne de résultat est alignée sur la vérité terrain et colore en rouge chaque substitution et insertion. Les suppressions (mots manquants dans le résultat) ne sont pas affichées dans la colonne de résultat — la colonne Attendu contient déjà toute la vérité terrain telle quelle.

Généré par wav2vec2 XLSR-53 MN Benchmark Runner · wav2vec2 XLSR-53 MN Batch API v2 · exécuté Aug 18, 2026, 5:41 PM