몽골어 음성-텍스트 리더보드

몽골어 음성-텍스트 공급자의 단어 오류율, 속도, 가격을 비교합니다. 모든 숫자는 실제 몽골어 오디오에서 실측 — 마케팅이 아닙니다.

사용한 데이터셋

각 제공업체 실행에 사용한 공개 음성 코퍼스입니다. 소스 URL을 열면 데이터셋 설명, 라이선스, 다운로드를 볼 수 있습니다.

WER 대 속도

각 점은 하나의 공급자. 이상적인 위치는 우하단(오류 적음, 빠름). 실제 몽골어 오디오에서 실측.

Google STTDuudlaga FlowSpeechmaticsChimegeOpenAI WhisperGPT-4o TranscribeAzure SpeechGladiaGemma 4Whisper large-v3Whisper large-v3-turboWhisper large-v2 MNSeamlessM4T v2MMS-1B-allMoonshine MNwav2vec2 XLSR-53 MNWhisper turbo MNWhisper medium MNElevenLabs Scribe v1ElevenLabs Scribe v2Qwen3-ASR-FlashDolphin smallOmniASR CTC-1BOmniASR LLM-1BVibeVoice ASRWhisper large-v3 MN

공급자 비교

모든 열을 정렬할 수 있습니다. 공급자의 샘플별 세부 내역, 가격, 방법을 보려면 상세를 클릭하세요.

공급자WERCER정확도속도지연가격 / 1000분
Speechmatics
14.4%7.4%85.6%0.51×13.8s$8.5상세
Duudlaga Flow자사
14.6%7.6%85.4%1.47×5.2s$19.4상세
Chimege
14.6%6.6%85.4%1.51×4.7s$11.1상세
Google STT
16.9%7.4%83.1%1.98×3.7s$16상세
Whisper large-v2 MN
20.7%8.3%79.3%0.53×13.5s$0상세
Azure Speech
20.8%9.7%79.2%0.39×17.3s$16.7상세
Whisper medium MN중복
22.5%8.9%77.5%2.7×2.7s$0상세
SeamlessM4T v2
24%11.1%76%0.39×26.3s$0상세
Whisper turbo MN중복
25.7%9.2%74.3%2.43×3.0s$0상세
ElevenLabs Scribe v1
27.1%10.8%72.9%2.14×3.3s$6.7상세
ElevenLabs Scribe v2
27.1%10.6%72.9%1.51×4.7s$3.7상세
Gemma 4
30.2%14.7%69.8%1×7.3s$0상세
OmniASR LLM-1B
33.8%14.2%66.2%0.27×26.6s$0상세
Whisper large-v3 MN중복
39.4%14.9%60.6%1.57×4.5s$0상세
MMS-1B-all
41.7%12.3%58.3%19.2×0.4s$0상세
wav2vec2 XLSR-53 MN중복
45%16.4%55%42.32×0.2s$0상세
Dolphin small
49.1%19.2%50.9%1.73×4.1s$0상세
OmniASR CTC-1B
51.2%15.5%48.8%0.6×11.7s$0상세
GPT-4o Transcribe
53%27.6%47%2.11×3.7s$6상세
Moonshine MN중복
58.8%45.2%41.2%8.44×0.8s$0상세
Whisper large-v3
89.5%37.4%10.5%1.29×6.0s$0상세
Gladia
90.1%38.9%9.9%0.75×9.4s$10.2상세
Whisper large-v3-turbo
99%54.4%1%0.91×8.7s$0상세
Qwen3-ASR-Flash
103.7%86.4%-3.7%2.19×3.2s$2.1상세
OpenAI Whisper
105.2%63.7%-5.2%1.5×4.5s$6상세
VibeVoice ASR
107%61%-7%0.53×12.1s$0상세
Gemini Flash
벤치마크 곧 공개

모든 결과는 실제 몽골어 데이터셋에서 실측했습니다. 속도는 × 실시간(높을수록 빠름). WER은 낮을수록 좋습니다.

중복이 배지가 붙은 모델은 벤치마크 코퍼스와 겹치는 데이터로 학습했습니다(몽골어 Common Voice — 173개 중 113개 샘플 — 또는 Shunya Labs의 공개 코퍼스). 겹치는 코퍼스의 점수는 암기 효과로 부풀려집니다. 이런 모델은 상세 페이지의 데이터셋별 표, 특히 학습에 쓰이지 않은 코퍼스를 기준으로 판단하세요.

Duudlaga Voice Set

92 samples · 10.2 min · 28 systems

A second corpus recorded first-party for this benchmark, covering what the public Mongolian datasets barely contain: modern loanwords, English/Mongolian code-switching, numbers, dates, and commands. Every system is measured on the same 92 recordings.

공급자WERCER정확도속도
1Duudlaga Flow자사
9.5%5.3%90.5%1.27×
2Google STT
11.7%5.5%88.3%2.28×
3Chimege
14.5%6.8%85.5%1.48×
4Speechmatics
15.3%7.6%84.7%0.5×
5Gemini 3.5 Flash
19.5%11.4%80.5%0.06×
6SeamlessM4T v2오픈소스
22.9%10.4%77.1%4.32×
7Whisper large-v2 MN오픈소스
23.2%10.9%76.8%0.55×
8ElevenLabs Scribe v1
23.4%9.3%76.6%2.09×
9ElevenLabs Scribe v2
24.6%9.8%75.4%1.47×
10Azure Speech
26.1%10.9%73.9%0.32×
11Gemma 4오픈소스
27.7%13.2%72.3%1.04×
12OmniASR LLM-1B오픈소스
34.5%14.5%65.5%0.27×
13Whisper medium MN오픈소스중복
35.1%14.8%64.9%2.71×
14Whisper turbo MN오픈소스중복
37.6%14.1%62.4%2.59×
15Whisper large-v3 MN오픈소스중복
41%17.1%59%1.58×
16GPT-4o Transcribe
44.3%23.7%55.7%2.62×
17MMS-1B-all오픈소스
45.3%15.1%54.7%20.52×
18Dolphin small오픈소스
46.1%19%53.9%1.69×
19W2v-BERT 2.0 MN오픈소스중복
46.3%18.2%53.7%28.12×
20OmniASR CTC-1B오픈소스
54.9%18.9%45.1%0.59×
21wav2vec2 XLSR-53 MN오픈소스중복
56.3%23.9%43.7%45.7×
22Whisper large-v3오픈소스
87.3%36.6%12.7%1.55×
23Gladia
88.1%39.9%11.9%0.74×
24Moonshine MN오픈소스중복
96.2%75.7%3.8%8.36×
25Whisper large-v3-turbo오픈소스
98.1%57.1%1.9%1.19×
26Qwen3-ASR-Flash
103.6%89.9%-3.6%2.07×
27OpenAI Whisper
104.6%63.8%-4.6%1.32×
28VibeVoice ASR오픈소스
110.1%64%-10.1%0.4×

이 벤치마크를 위해 직접 녹음했습니다 — 오디오는 배포하지 않고 지표만 공개합니다.