몽골어 음성-텍스트 리더보드
OpenAI Whisper동작점: whisper-1

OpenAI Whisper — 몽골어 음성-텍스트 벤치마크

OpenAI Whisper Batch API(향상된 운용 지점, 언어 mn)를 4개 몽골어 데이터셋과 265개 오디오 샘플로 평가한 실제 결과입니다. 아래의 모든 숫자는 마케팅이 아닌 실측값입니다. WER, 속도, 가격은 있는 그대로, 가감 없이 솔직하게 표시합니다.

언어:MN화자 분리:none샘플:265실행:Aug 14, 2026, 4:21 PM엔드포인트:https://api.openai.com/v1/audio/transcriptions
067100-5.2%
정확도

265/265 샘플 전사 · 100% 성공

067100105.2%
단어 오류율

낮을수록 좋음 · 265개 샘플 기준

핵심 지표
문자 오류율63.7%
평균 속도 계수1.5×실시간 배수
전체 속도 계수1.5×
샘플당 평균 지연4.5s
처리한 오디오 합계1849.3s30.8분

가격

OpenAI Whisper의 일괄 전사 정가입니다. 할인이나 협상된 요금은 반영하지 않은 원시 분당 요금입니다.

1000분당
$6
일괄
분당
$0.0060
실효
1000분당(이 30.8분)
$11.10
비용
오픈소스?
독점

가격 출처: OpenAI Whisper 공개 가격. Duudlaga Flow는 참고용으로만 표시합니다. 이 페이지는 OpenAI Whisper만 단독으로 다루어 숫자가 자사 제품으로 부풀려지지 않음을 보여줍니다.

데이터셋별 WER 및 CER

데이터셋별 단어·문자 오류율입니다. 낮을수록 좋으며, 이는 OpenAI Whisper의 실제 숫자로 Common Voice 24에서 약합니다.

Common Voice 24 (MN)
원본 데이터셋 →
WER
104%
CER
63.4%
Shunya Labs Mongolian Speech
원본 데이터셋 →
WER
104.1%
CER
61.3%
Common Voice 20 (MN)
원본 데이터셋 →
WER
111.6%
CER
69.7%
Modern Voice
WER
103%
CER
61.9%
WERCER

데이터셋 요약

각 데이터셋의 종합 정확도, 속도, 소요 시간.

데이터셋출처샘플성공WERCER정확도속도오디오(초)처리(초)
Common Voice 24 (MN)Hugging Face →5959/59104%63.4%-4.0%1.95×330.6s169.5s
Shunya Labs Mongolian SpeechHugging Face →6060/60104.1%61.3%-4.1%1.39×645.1s462.7s
Common Voice 20 (MN)Hugging Face →5454/54111.6%69.7%-11.6%1.96×269.8s137.6s
Modern Voice9292/92103%61.9%-3.0%1.3×603.8s464.9s

WER 대 속도 — 샘플별

각 점은 하나의 오디오 샘플입니다. 이상적인 위치는 좌하단(오류 적음, 빠름)입니다. OpenAI Whisper는 많은 Common Voice 24 샘플에서 오류가 높습니다.

샘플별 결과

“기대” 열에 정답을 그대로 표시합니다. 결과 열은 OpenAI Whisper가 틀린 단어만 빨간색으로 강조합니다 — 취소선/교체 없이 오류만 보여줍니다.

265행
빨강결과의 잘못된 단어보통정확히 전사됨“기대” 열은 정답으로 그대로 표시
#오디오샘플데이터셋기대(정답)OpenAI Whisper 결과WERCERI/D/S
1btsee_0001Common Voice 24 (MN)Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье.Ұлдэ әм сұл ұраңаса омін тәнді мидді джаға ға хелі.125.0%55.2%2/0/8
2btsee_0002Common Voice 24 (MN)Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү?Нады дзэйэ санғад джырғал кетегерді Ұрғун сарай ұқыцат табай сіңгіджу.100.0%58.7%0/2/10
3btsee_0003Common Voice 24 (MN)Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе.Ұтағди дұрс дұршиң үйгісі салғих джүцүгі.100.0%73.1%0/1/6
4btsee_0004Common Voice 24 (MN)Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн.Би бас қалту хэлээр кир үсгээр дирхи джақты қун.90.0%49.0%0/1/8
5btsee_0005Common Voice 24 (MN)Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ.Қан құрымас дұғардас бұл түкө бұрауңы ұңы қоҵірд лоңғар нергүр шер ең бұл дзең.140.0%71.4%4/0/10
6btsee_0006Common Voice 24 (MN)Алив наашаа ороод ир гээд гэртээ оров.Әлімн әше орадыр, кеткісті орығы.100.0%67.6%0/2/5
7btsee_0007Common Voice 24 (MN)Өө өндөр дээдэс таны тухайд би баталж чадахгүй.Ө, өндөрді цітаңи тұқад, бі бақталік жәл тұқғи.100.0%56.5%0/0/8
8btsee_0008Common Voice 24 (MN)Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.Қырын үріптүң ұтаңыз екілің Ұмұс ек сәңұрғы джіңіліу.100.0%76.8%0/0/8
9btsee_0009Common Voice 24 (MN)Та нар очингуутаа шөл л өгч үз.Таныр ұчыңғута шүлілд ұқчүд.100.0%50.0%0/3/4
10btsee_0010Common Voice 24 (MN)Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь.Еру сөл өлтур өссес әлта өгі өп сөйімчін.114.3%70.8%1/0/7
1 / 27 페이지

방법론

이 숫자들이 도출된 방식.

제공자: OpenAI Whisper (OpenAI whisper-1 hosted transcription (auto language detection; 'mn' is not an accepted language hint).).

엔드포인트 https://api.openai.com/v1/audio/transcriptions. 언어 mn. 동작점 whisper-1. 화자 분리 none.

데이터셋: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265개 샘플, 오디오 총 1849.3s.

데이터셋 원본 URL:

지표: WER과 CER은 대소문자와 구두점을 정규화한 표준 단어/문자 레벤슈타인 정렬로 계산합니다. 정확도 = 100 − WER. 속도 계수 = 오디오 길이 ÷ 처리 시간(× 실시간). 모든 요청은 실제 OpenAI Whisper Batch API 호출이며 캐시나 시뮬레이션이 아닙니다.

차이 강조: 결과 열은 정답에 정렬하여 모든 치환과 삽입을 빨간색으로 표시합니다. 삭제(결과에 빠진 단어)는 결과 열에 표시하지 않으며 “기대” 열이 정답 전체를 그대로 보유합니다.

OpenAI Whisper Benchmark Runner가 생성 · OpenAI Whisper Batch API v2 · 실행 Aug 14, 2026, 4:21 PM