蒙古语语音转文字排行榜
wav2vec2 XLSR-53 MN工作点: anton-l/wav2vec2-large-xlsr-53-mongolian (CTC) on mps

wav2vec2 XLSR-53 MN — 蒙古语语音转文字基准测试

wav2vec2 XLSR-53 MN Batch API(增强工作点,语言 mn)在 4 个蒙古语数据集和 265 个音频样本上的真实结果。下方所有数字均为实测,非营销话术。WER、速度与定价如实呈现,毫不粉饰。

语言:MN说话人分离:none样本:265运行:Aug 18, 2026, 5:41 PM端点:local (transformers)
06710055%
准确率

265/265 个样本已转录 · 100% 成功

06710045%
词错误率

越低越好 · 覆盖 265 个样本

核心指标
字符错误率16.4%
平均速度系数42.32×实时倍率
总速度系数42.32×
每样本平均延迟0.2s
已处理音频总量1849.3s30.8 分钟

定价

wav2vec2 XLSR-53 MN 批量转写的公开标价。无折扣、无协议价——原始的每分钟费率。

每 1000 分钟
$0
批量
每分钟
$0.0000
有效
每 1000 分钟(本页 30.8 分钟)
$0.00
将花费
开源?
专有

定价来源:wav2vec2 XLSR-53 MN 公开定价。Duudlaga Flow 仅供参考——本页单独呈现 wav2vec2 XLSR-53 MN,数字不被自家产品注水。

各数据集的 WER 与 CER

各数据集的词错误率与字符错误率。越低越好——这些是 wav2vec2 XLSR-53 MN 的真实数字,在 Common Voice 24 上较弱。

Common Voice 24 (MN)
源数据集 →
WER
37.2%
CER
11.4%
Shunya Labs Mongolian Speech
源数据集 →
WER
44.6%
CER
15.3%
Common Voice 20 (MN)
源数据集 →
WER
31.7%
CER
9.6%
Modern Voice
WER
58%
CER
24.3%
WERCER

数据集汇总

每个数据集的汇总准确率、速度与耗时。

数据集来源样本成功WERCER准确率速度音频(秒)处理(秒)
Common Voice 24 (MN)Hugging Face →5959/5937.2%11.4%62.8%37.32×330.6s8.9s
Shunya Labs Mongolian SpeechHugging Face →6060/6044.6%15.3%55.4%45.18×645.1s14.3s
Common Voice 20 (MN)Hugging Face →5454/5431.7%9.6%68.3%37.72×269.8s7.2s
Modern Voice9292/9258%24.3%42.0%45.1×603.8s13.4s

WER 与速度——按样本

每个点为一个音频样本。理想位置在左下角(低误差、高速度)。wav2vec2 XLSR-53 MN 在许多 Common Voice 24 样本上误差较高。

逐样本结果

“期望”列原样展示基准真相。结果列仅将 wav2vec2 XLSR-53 MN 转错的词标红——无删除线替换,只显示错误。

265 行
红色结果中的错误词普通转写正确“期望”列原样作为基准真相展示
#音频样本数据集期望(基准真相)wav2vec2 XLSR-53 MN 结果WERCERI/D/S
1btsee_0001Common Voice 24 (MN)Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье.гэхдээ амьсгал хураахаасаа өмнө танд мэдэж ягаагаа хэлэе25.0%6.9%0/0/2
2btsee_0002Common Voice 24 (MN)Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү?надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж хүү8.3%1.3%0/0/1
3btsee_0003Common Voice 24 (MN)Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе.одоо бид өөрждөө өвчин эмгийдээсээ салахыг хичээцгээ гийдэг57.1%21.2%1/0/3
4btsee_0004Common Voice 24 (MN)Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн.би бол голдуу хээрээр гэр хэчээр дэр хийж явдаг хүн10.0%2.0%0/0/1
5btsee_0005Common Voice 24 (MN)Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ.тав хурамжт уулаж болдоггүй бур вгүн хоёр луугаар нэргүүл хэрэгүлжээ90.0%29.9%0/0/9
6btsee_0006Common Voice 24 (MN)Алив наашаа ороод ир гээд гэртээ оров.алив наашаа оройдр гээд гэртээ оров28.6%8.1%0/1/1
7btsee_0007Common Voice 24 (MN)Өө өндөр дээдэс таны тухайд би баталж чадахгүй.өө өндөр дээд таны тухайд би баталж чадахгүй12.5%4.3%0/0/1
8btsee_0008Common Voice 24 (MN)Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.харин гурав даг удаагаас эхлэх хүмүүсийг сонирхож эхлэв25.0%5.4%0/0/2
9btsee_0009Common Voice 24 (MN)Та нар очингуутаа шөл л өгч үз.та нар очингуутаа шүлэл өгч үз28.6%6.7%0/1/1
10btsee_0010Common Voice 24 (MN)Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь.ерөөсөө л үйлдвэрээсээ салуугүй орсон юм чинь42.9%16.7%0/0/3
第 1 / 27 页

方法

这些数字如何得出。

提供商: wav2vec2 XLSR-53 MN (wav2vec2 XLSR-53 fine-tuned on Mongolian Common Voice — by download count the most-used Mongolian-specific open ASR model on the Hub. CTC output, so no punctuation or casing.). 带此标记的模型,其训练数据与本基准的语料库存在重叠(蒙古语 Common Voice——173 条样本中的 113 条——或 Shunya Labs 的公开语料库)。在重叠语料上的成绩会因记忆而虚高;请以详情页中按数据集划分的表格来评判这些模型,尤其看它们未曾训练过的语料库。

端点 local (transformers). 语言 mn. 工作点 anton-l/wav2vec2-large-xlsr-53-mongolian (CTC) on mps. 说话人分离 none.

数据集: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 个样本,音频共 1849.3s。

数据集来源链接:

指标: WER 与 CER 通过标准的词/字符莱文斯坦距离对齐计算,并按大小写与标点归一化。准确率 = 100 − WER。速度系数 = 音频时长 ÷ 处理时间(× 实时)。所有请求均为真实的 wav2vec2 XLSR-53 MN Batch API 调用,非缓存或模拟。

差异高亮: 结果列与基准真相对齐,将每个替换与插入标红。删除(结果中缺失的词)不在结果列显示——“期望”列已完整保留基准真相原样。

由 wav2vec2 XLSR-53 MN Benchmark Runner 生成 · wav2vec2 XLSR-53 MN Batch API v2 · 运行 Aug 18, 2026, 5:41 PM