蒙古语语音转文字排行榜
GPT-4o Transcribe工作点: gpt-4o-transcribe

GPT-4o Transcribe — 蒙古语语音转文字基准测试

GPT-4o Transcribe Batch API(增强工作点,语言 mn)在 4 个蒙古语数据集和 265 个音频样本上的真实结果。下方所有数字均为实测,非营销话术。WER、速度与定价如实呈现,毫不粉饰。

语言:MN说话人分离:none样本:265运行:Aug 14, 2026, 4:21 PM端点:https://api.openai.com/v1/audio/transcriptions
06710047%
准确率

265/265 个样本已转录 · 100% 成功

06710053%
词错误率

越低越好 · 覆盖 265 个样本

核心指标
字符错误率27.6%
平均速度系数2.11×实时倍率
总速度系数2.11×
每样本平均延迟3.7s
已处理音频总量1849.3s30.8 分钟

定价

GPT-4o Transcribe 批量转写的公开标价。无折扣、无协议价——原始的每分钟费率。

每 1000 分钟
$6
批量
每分钟
$0.0060
有效
每 1000 分钟(本页 30.8 分钟)
$11.10
将花费
开源?
专有

定价来源:GPT-4o Transcribe 公开定价。Duudlaga Flow 仅供参考——本页单独呈现 GPT-4o Transcribe,数字不被自家产品注水。

各数据集的 WER 与 CER

各数据集的词错误率与字符错误率。越低越好——这些是 GPT-4o Transcribe 的真实数字,在 Common Voice 24 上较弱。

Common Voice 24 (MN)
源数据集 →
WER
61.3%
CER
31.1%
Shunya Labs Mongolian Speech
源数据集 →
WER
41.7%
CER
19.4%
Common Voice 20 (MN)
源数据集 →
WER
65.9%
CER
36.4%
Modern Voice
WER
47.4%
CER
25.5%
WERCER

数据集汇总

每个数据集的汇总准确率、速度与耗时。

数据集来源样本成功WERCER准确率速度音频(秒)处理(秒)
Common Voice 24 (MN)Hugging Face →5959/5961.3%31.1%38.7%2.73×330.6s121.2s
Shunya Labs Mongolian SpeechHugging Face →6060/6041.7%19.4%58.3%1.67×645.1s386.8s
Common Voice 20 (MN)Hugging Face →5454/5465.9%36.4%34.1%2.01×269.8s133.9s
Modern Voice9292/9247.4%25.5%52.6%2.59×603.8s233.4s

WER 与速度——按样本

每个点为一个音频样本。理想位置在左下角(低误差、高速度)。GPT-4o Transcribe 在许多 Common Voice 24 样本上误差较高。

逐样本结果

“期望”列原样展示基准真相。结果列仅将 GPT-4o Transcribe 转错的词标红——无删除线替换,只显示错误。

265 行
红色结果中的错误词普通转写正确“期望”列原样作为基准真相展示
#音频样本数据集期望(基准真相)GPT-4o Transcribe 结果WERCERI/D/S
1btsee_0001Common Voice 24 (MN)Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье.Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж яваагаа хэлье.12.5%6.9%0/0/1
2btsee_0002Common Voice 24 (MN)Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү?Надад сая санагдаж байгаа гэхэд ердөө гурван сарийн хугацаатай байсан л гэж үү?58.3%22.7%1/0/6
3btsee_0003Common Voice 24 (MN)Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе.Одоо би дуртай хүнтэйгээ салахыг хүсч байгаа.85.7%51.9%0/0/6
4btsee_0004Common Voice 24 (MN)Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн.Би бас голдуу хэрээр гэр, хэцэр дээр хийж явдаг хүн.40.0%9.8%0/0/4
5btsee_0005Common Voice 24 (MN)Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ.Хаварын сүүлчээс барлагийн хоёр зоогоор нэргүүл шарив.100.0%66.2%0/3/7
6btsee_0006Common Voice 24 (MN)Алив наашаа ороод ир гээд гэртээ оров.Айсин наашаараад ир, гэж гэртээ оров.57.1%24.3%0/1/3
7btsee_0007Common Voice 24 (MN)Өө өндөр дээдэс таны тухайд би баталж чадахгүй.Оо, өндөртэд таныг тохойод би баталж чадахгүй.62.5%23.9%0/1/4
8btsee_0008Common Voice 24 (MN)Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.Харин 33 дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.12.5%8.9%0/0/1
9btsee_0009Common Voice 24 (MN)Та нар очингуутаа шөл л өгч үз.Та нар орчлонгоудаа шүүлт өгч үз.42.9%30.0%0/1/2
10btsee_0010Common Voice 24 (MN)Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь.Ирүүсөөл үлдүүрээсээ салаагүй явсна юм чинь.57.1%25.0%0/1/3
第 1 / 27 页

方法

这些数字如何得出。

提供商: GPT-4o Transcribe (OpenAI gpt-4o-transcribe hosted transcription (Mongolian prompt hint; 'mn' is not an accepted language code).).

端点 https://api.openai.com/v1/audio/transcriptions. 语言 mn. 工作点 gpt-4o-transcribe. 说话人分离 none.

数据集: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 个样本,音频共 1849.3s。

数据集来源链接:

指标: WER 与 CER 通过标准的词/字符莱文斯坦距离对齐计算,并按大小写与标点归一化。准确率 = 100 − WER。速度系数 = 音频时长 ÷ 处理时间(× 实时)。所有请求均为真实的 GPT-4o Transcribe Batch API 调用,非缓存或模拟。

差异高亮: 结果列与基准真相对齐,将每个替换与插入标红。删除(结果中缺失的词)不在结果列显示——“期望”列已完整保留基准真相原样。

由 GPT-4o Transcribe Benchmark Runner 生成 · GPT-4o Transcribe Batch API v2 · 运行 Aug 14, 2026, 4:21 PM