Рейтинг розпізнавання монгольської мови
Google STTЕндпоінт: http://localhost:8080/transcribe

Google STT — Бенчмарк розпізнавання монгольської мови

Реальні результати Google STT Batch API (покращена робоча точка, мова mn-MN), оцінені на 4 монгольських датасетах і 265 аудіозразках. Усі числа нижче виміряні, а не з маркетингу. WER, швидкість і ціна показані як є, максимально чесно.

Мова:MN-MNЗразки:265Запуск:Jul 15, 2026, 6:36 AMЕндпоінт:http://localhost:8080/transcribe
06710083.1%
Точність

265/265 зразків розшифровано · 100% успіх

06710016.9%
Коефіцієнт помилок у словах

Чим менше, тим краще · на 265 зразках

Ключові метрики
Коефіцієнт помилок у символах7.4%
Середній коефіцієнт швидкості1.98×кратність реального часу
Загальний коефіцієнт швидкості1.98×
Середня затримка на зразок3.7s
Усього оброблено аудіо1849.3s30.8 хв

Ціна

Прайс-лист Google STT для пакетної транскрипції. Без знижок і узгоджених тарифів — базова ціна за хвилину.

За 1000 хвилин
$16
пакет
За хвилину
$0.0160
ефективно
За 1000 хв (ці 30.8 хв)
$29.59
обійдеться в
Відкритий вихідний код?
пропрієтарний

Джерело ціни: публічні ціни Google STT. Duudlaga Flow показано лише для контексту — ця сторінка ізолює Google STT, щоб число не завищувалось за рахунок нашого продукту.

WER і CER за датасетами

Коефіцієнти помилок у словах і символах за датасетами. Чим менше, тим краще — і це реальні числа Google STT, слабкі на Common Voice 24.

WER
16.7%
CER
6%
Shunya Labs Mongolian Speech
Початковий датасет →
WER
10.5%
CER
4%
WER
21.3%
CER
8.7%
Modern Voice
WER
18.7%
CER
9.9%
WERCER

Зведення за датасетами

Сумарна точність, швидкість і час за кожним датасетом.

ДатасетДжерелоЗразкиУспіхWERCERТочністьШвидкістьАудіо (с)Оброб. (с)
Common Voice 24 (MN)Hugging Face →5959/5916.7%6%83.3%2.03×ss
Shunya Labs Mongolian SpeechHugging Face →6060/6010.5%4%89.5%2.45×ss
Common Voice 20 (MN)Hugging Face →5454/5421.3%8.7%78.7%1.44×ss
Modern Voice9292/9218.7%9.9%81.3%2.06×603.8s293s

WER проти швидкості — за зразками

Кожна точка — один аудіозразок. Ідеальна зона — ліворуч внизу (мало помилок, швидко). Google STT дає високий рівень помилок на багатьох зразках Common Voice 24.

Результати за зразками

Еталон показано дослівно у колоні «Очікується». Колона результату підсвічує червоним лише слова, які Google STT розпізнав невірно — без закреслень і замін, лише помилки.

265 рядків
червонийневірне слово в результатізвичайнийрозпізнано вірноКолона «Очікується» показана дослівно як еталон
#АудіоЗразокДатасетОчікується (еталон)Результат Google STTWERCERI/D/S
1btsee-cv24-mn-0001Common Voice 24 (MN)Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье.Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье.0.0%0.0%0/0/0
2btsee-cv24-mn-0002Common Voice 24 (MN)Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү?Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү?0.0%0.0%0/0/0
3btsee-cv24-mn-0003Common Voice 24 (MN)Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе.Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе.0.0%0.0%0/0/0
4btsee-cv24-mn-0004Common Voice 24 (MN)Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн.Би бол голдуу хээрээр гэр хэцээр дэр хийж явдаг хүн.0.0%0.0%0/0/0
5btsee-cv24-mn-0005Common Voice 24 (MN)Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ.Хаан Хормистуусын болтугай баруун хоёр дахь луугаар нэргүүлэхээр явжээ.100.0%41.6%0/1/9
6btsee-cv24-mn-0006Common Voice 24 (MN)Алив наашаа ороод ир гээд гэртээ оров.Алив наашаа ороод ир гээд гэртээ оров.0.0%0.0%0/0/0
7btsee-cv24-mn-0007Common Voice 24 (MN)Өө өндөр дээдэс таны тухайд би баталж чадахгүй.Өө, өндөр дээдэс, таны тухайд би баталж чадахгүй.0.0%0.0%0/0/0
8btsee-cv24-mn-0008Common Voice 24 (MN)Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.Харин гурав дахь удаагаасаа эхлэн хүмүүсийг сонирхож эхлэв.12.5%3.6%0/0/1
9btsee-cv24-mn-0009Common Voice 24 (MN)Та нар очингуутаа шөл л өгч үз.Та нар очингуутаа шүлэл өгч үз.28.6%6.7%0/1/1
10btsee-cv24-mn-0010Common Voice 24 (MN)Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь.Ерөөсөө л үйлдвэрээсээ салаагүй явсан юм чинь.14.3%6.2%0/0/1
Сторінка 1 з 27

Методологія

Як отримано ці числа.

Постачальник: Google STT (Google Cloud Speech-to-Text V2 raw transcription.).

Ендпоінт http://localhost:8080/transcribe. Мова mn-MN. Пунктуацію видалено для WER.

Датасети: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 зразків, усього 1849.3s аудіо.

Посилання на джерела датасетів:

Метрики: WER і CER обчислюються стандартним вирівнюванням Левенштейна за словами/символами з нормалізацією регістру та пунктуації. Точність = 100 − WER. Коефіцієнт швидкості = тривалість аудіо ÷ час обробки (× реальний час). Усі запити — реальні виклики Batch API Google STT, не з кешу й не симульовані.

Підсвітка різниць: Колона результату вирівнюється за еталоном і підсвічує червоним кожну заміну та вставку. Видалення (слова, відсутні в результаті) не показуються у колоні результату — колонка «Очікується» вже містить повний еталон як є.

Створено Google STT Benchmark Runner · Google STT Batch API v2 · запуск Jul 15, 2026, 6:36 AM