蒙古语语音转文字排行榜
ElevenLabs Scribe v2工作点: scribe_v2

ElevenLabs Scribe v2 — 蒙古语语音转文字基准测试

ElevenLabs Scribe v2 Batch API(增强工作点,语言 mn)在 4 个蒙古语数据集和 265 个音频样本上的真实结果。下方所有数字均为实测,非营销话术。WER、速度与定价如实呈现,毫不粉饰。

语言:MN说话人分离:none样本:265运行:Aug 19, 2026, 6:13 PM端点:https://api.elevenlabs.io/v1/speech-to-text
06710072.9%
准确率

265/265 个样本已转录 · 100% 成功

06710027.1%
词错误率

越低越好 · 覆盖 265 个样本

核心指标
字符错误率10.6%
平均速度系数1.51×实时倍率
总速度系数1.51×
每样本平均延迟4.7s
已处理音频总量1849.3s30.8 分钟

定价

ElevenLabs Scribe v2 批量转写的公开标价。无折扣、无协议价——原始的每分钟费率。

每 1000 分钟
$3.7
批量
每分钟
$0.0037
有效
每 1000 分钟(本页 30.8 分钟)
$6.84
将花费
开源?
专有

定价来源:ElevenLabs Scribe v2 公开定价。Duudlaga Flow 仅供参考——本页单独呈现 ElevenLabs Scribe v2,数字不被自家产品注水。

各数据集的 WER 与 CER

各数据集的词错误率与字符错误率。越低越好——这些是 ElevenLabs Scribe v2 的真实数字,在 Common Voice 24 上较弱。

Common Voice 24 (MN)
源数据集 →
WER
28.5%
CER
10.6%
Shunya Labs Mongolian Speech
源数据集 →
WER
19.2%
CER
6.3%
Common Voice 20 (MN)
源数据集 →
WER
29.4%
CER
11.4%
Modern Voice
WER
29.8%
CER
13%
WERCER

数据集汇总

每个数据集的汇总准确率、速度与耗时。

数据集来源样本成功WERCER准确率速度音频(秒)处理(秒)
Common Voice 24 (MN)Hugging Face →5959/5928.5%10.6%71.5%1.33×330.6s248.1s
Shunya Labs Mongolian SpeechHugging Face →6060/6019.2%6.3%80.8%1.74×645.1s370.3s
Common Voice 20 (MN)Hugging Face →5454/5429.4%11.4%70.6%1.41×269.8s190.7s
Modern Voice9292/9229.8%13%70.2%1.45×603.8s416s

WER 与速度——按样本

每个点为一个音频样本。理想位置在左下角(低误差、高速度)。ElevenLabs Scribe v2 在许多 Common Voice 24 样本上误差较高。

逐样本结果

“期望”列原样展示基准真相。结果列仅将 ElevenLabs Scribe v2 转错的词标红——无删除线替换,只显示错误。

265 行
红色结果中的错误词普通转写正确“期望”列原样作为基准真相展示
#音频样本数据集期望(基准真相)ElevenLabs Scribe v2 结果WERCERI/D/S
1btsee_0001Common Voice 24 (MN)Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье.Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье0.0%0.0%0/0/0
2btsee_0002Common Voice 24 (MN)Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү?Надад заяасан аж жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү?8.3%1.3%0/0/1
3btsee_0003Common Voice 24 (MN)Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе.Одоо бид өөрсдөө өвчин эмнэлгээсээ салахыг хичээцгээе.14.3%3.8%0/0/1
4btsee_0004Common Voice 24 (MN)Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн.Би бол голдуй хээрээр гэр, хэцээр дэр хийж явдаг хүн.10.0%2.0%0/0/1
5btsee_0005Common Voice 24 (MN)Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ.Хан хурмаст уулс болдоггүй бороо өгнө. Хоёр луугаар нэргүүлэхээр явагч70.0%26.0%0/0/7
6btsee_0006Common Voice 24 (MN)Алив наашаа ороод ир гээд гэртээ оров.Алив наашаа ороод ир гээд гэртээ оров.0.0%0.0%0/0/0
7btsee_0007Common Voice 24 (MN)Өө өндөр дээдэс таны тухайд би баталж чадахгүй.Өө, өндөр дээдс таны тухайд би ботолг чадахгүй25.0%8.7%0/0/2
8btsee_0008Common Voice 24 (MN)Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.0.0%0.0%0/0/0
9btsee_0009Common Voice 24 (MN)Та нар очингуутаа шөл л өгч үз.Та нар очгондоо шүлэл өгч үз42.9%30.0%0/1/2
10btsee_0010Common Voice 24 (MN)Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь.Эрүүлсээл үйлдвэрээсээ салаагүй явсан юм чинь28.6%20.8%0/1/1
第 1 / 27 页

方法

这些数字如何得出。

提供商: ElevenLabs Scribe v2 (ElevenLabs Scribe v2 hosted transcription (language_code=mn).).

端点 https://api.elevenlabs.io/v1/speech-to-text. 语言 mn. 工作点 scribe_v2. 说话人分离 none.

数据集: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 个样本,音频共 1849.3s。

数据集来源链接:

指标: WER 与 CER 通过标准的词/字符莱文斯坦距离对齐计算,并按大小写与标点归一化。准确率 = 100 − WER。速度系数 = 音频时长 ÷ 处理时间(× 实时)。所有请求均为真实的 ElevenLabs Scribe v2 Batch API 调用,非缓存或模拟。

差异高亮: 结果列与基准真相对齐,将每个替换与插入标红。删除(结果中缺失的词)不在结果列显示——“期望”列已完整保留基准真相原样。

由 ElevenLabs Scribe v2 Benchmark Runner 生成 · ElevenLabs Scribe v2 Batch API v2 · 运行 Aug 19, 2026, 6:13 PM