Whisper large-v3 MN — 몽골어 음성-텍스트 벤치마크
Whisper large-v3 MN Batch API(향상된 운용 지점, 언어 mn)를 4개 몽골어 데이터셋과 265개 오디오 샘플로 평가한 실제 결과입니다. 아래의 모든 숫자는 마케팅이 아닌 실측값입니다. WER, 속도, 가격은 있는 그대로, 가감 없이 솔직하게 표시합니다.
265/265 샘플 전사 · 100% 성공
낮을수록 좋음 · 265개 샘플 기준
가격
Whisper large-v3 MN의 일괄 전사 정가입니다. 할인이나 협상된 요금은 반영하지 않은 원시 분당 요금입니다.
가격 출처: Whisper large-v3 MN 공개 가격. Duudlaga Flow는 참고용으로만 표시합니다. 이 페이지는 Whisper large-v3 MN만 단독으로 다루어 숫자가 자사 제품으로 부풀려지지 않음을 보여줍니다.
데이터셋별 WER 및 CER
데이터셋별 단어·문자 오류율입니다. 낮을수록 좋으며, 이는 Whisper large-v3 MN의 실제 숫자로 Common Voice 24에서 약합니다.
데이터셋 요약
각 데이터셋의 종합 정확도, 속도, 소요 시간.
| 데이터셋 | 출처 | 샘플 | 성공 | WER | CER | 정확도 | 속도 | 오디오(초) | 처리(초) |
|---|---|---|---|---|---|---|---|---|---|
| Common Voice 24 (MN) | Hugging Face → | 59 | 59/59 | 40.1% | 13.1% | 59.9% | 1.51× | 330.6s | 218.4s |
| Shunya Labs Mongolian Speech | Hugging Face → | 60 | 60/60 | 28.6% | 8.8% | 71.4% | 1.76× | 645.1s | 367.1s |
| Common Voice 20 (MN) | Hugging Face → | 54 | 54/54 | 41.3% | 15.8% | 58.7% | 1.34× | 269.8s | 200.9s |
| Modern Voice | — | 92 | 92/92 | 44.9% | 19.3% | 55.1% | 1.56× | 603.8s | 388.2s |
WER 대 속도 — 샘플별
각 점은 하나의 오디오 샘플입니다. 이상적인 위치는 좌하단(오류 적음, 빠름)입니다. Whisper large-v3 MN는 많은 Common Voice 24 샘플에서 오류가 높습니다.
샘플별 결과
“기대” 열에 정답을 그대로 표시합니다. 결과 열은 Whisper large-v3 MN가 틀린 단어만 빨간색으로 강조합니다 — 취소선/교체 없이 오류만 보여줍니다.
| # | 오디오 | 샘플 | 데이터셋 | 기대(정답) | Whisper large-v3 MN 결과 | WER | CER | I/D/S |
|---|---|---|---|---|---|---|---|---|
| 1 | btsee_0001 | Common Voice 24 (MN) | Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье. | гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлээ | 12.5% | 3.4% | 0/0/1 | |
| 2 | btsee_0002 | Common Voice 24 (MN) | Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү? | надад заяасан аж жаргал гэдэг эрдээ гуравхан сарын хугацаатай байсан гэж үү | 16.7% | 5.3% | 0/0/2 | |
| 3 | btsee_0003 | Common Voice 24 (MN) | Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе. | одоо би дөөрч дөө өвчин эмгээгээсээ салахыг чивцгээв | 71.4% | 19.2% | 1/0/4 | |
| 4 | btsee_0004 | Common Voice 24 (MN) | Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн. | би бол голдуу хээрээр гэр хэцээр дэрхий ч явдаг хүн | 20.0% | 5.9% | 0/0/2 | |
| 5 | btsee_0005 | Common Voice 24 (MN) | Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ. | ханхурамс дуурлас болдоггүй бороогүйн хоёр луугаар нэргүүлэхээр явуулжээ | 80.0% | 22.1% | 0/2/6 | |
| 6 | btsee_0006 | Common Voice 24 (MN) | Алив наашаа ороод ир гээд гэртээ оров. | алив наашаа ороодор гээд гэртэй оров | 42.9% | 8.1% | 0/1/2 | |
| 7 | btsee_0007 | Common Voice 24 (MN) | Өө өндөр дээдэс таны тухайд би баталж чадахгүй. | өө өндөр дээд таны тухайд би батал ч алдахгүй | 50.0% | 10.9% | 1/0/3 | |
| 8 | btsee_0008 | Common Voice 24 (MN) | Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв. | харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв | 0.0% | 0.0% | 0/0/0 | |
| 9 | btsee_0009 | Common Voice 24 (MN) | Та нар очингуутаа шөл л өгч үз. | танар очингуутаа шөлөл өгчүүз | 85.7% | 10.0% | 0/3/3 | |
| 10 | btsee_0010 | Common Voice 24 (MN) | Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь. | ерөөсөө л үйлдвэрээсээ салаагүй явсан юм чинь | 14.3% | 6.2% | 0/0/1 |
방법론
이 숫자들이 도출된 방식.
제공자: Whisper large-v3 MN (Whisper large-v3 fine-tuned on Mongolian Common Voice 16.1 + FLEURS. Same author as the Common Voice 20 corpus in this benchmark, so its Common Voice scores should be read with train/test overlap in mind.). 이 배지가 붙은 모델은 벤치마크 코퍼스와 겹치는 데이터로 학습했습니다(몽골어 Common Voice — 173개 중 113개 샘플 — 또는 Shunya Labs의 공개 코퍼스). 겹치는 코퍼스의 점수는 암기 효과로 부풀려집니다. 이런 모델은 상세 페이지의 데이터셋별 표, 특히 학습에 쓰이지 않은 코퍼스를 기준으로 판단하세요.
엔드포인트 local (transformers). 언어 mn. 동작점 warmestman/whisper-large-v3-mn-cv-fleurs (Mongolian fine-tune) on mps. 화자 분리 none.
데이터셋: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265개 샘플, 오디오 총 1849.3s.
- Common Voice 24 (MN)https://huggingface.co/datasets/btsee/common-voices-24-mn
- Shunya Labs Mongolian Speechhttps://huggingface.co/datasets/shunyalabs/mongolian-speech-dataset
- Common Voice 20 (MN)https://huggingface.co/datasets/warmestman/common-voice-20-mn-normalized
- Modern Voice—
지표: WER과 CER은 대소문자와 구두점을 정규화한 표준 단어/문자 레벤슈타인 정렬로 계산합니다. 정확도 = 100 − WER. 속도 계수 = 오디오 길이 ÷ 처리 시간(× 실시간). 모든 요청은 실제 Whisper large-v3 MN Batch API 호출이며 캐시나 시뮬레이션이 아닙니다.
차이 강조: 결과 열은 정답에 정렬하여 모든 치환과 삽입을 빨간색으로 표시합니다. 삭제(결과에 빠진 단어)는 결과 열에 표시하지 않으며 “기대” 열이 정답 전체를 그대로 보유합니다.