Whisper large-v3-turbo — Benchmark de reconnaissance vocale en mongol
Résultats réels de la Whisper large-v3-turbo Batch API (point de fonctionnement avancé, langue mn) évalués sur 4 jeux de données mongols et 265 échantillons audio. Tous les chiffres ci-dessous sont mesurés, pas du marketing. Le WER, la vitesse et le prix sont affichés tels quels, brutalement honnêtes.
265/265 échantillons transcrits · 100 % de réussite
Plus bas c'est mieux · sur 265 échantillons
Tarification
Tarif public Whisper large-v3-turbo pour la transcription par lot. Aucune remise ni tarif négocié — le tarif brut par minute.
Source du prix : tarification publique de Whisper large-v3-turbo. Duudlaga Flow est affiché pour contexte uniquement — cette page isole Whisper large-v3-turbo pour que le chiffre ne soit pas gonflé par notre produit.
WER et CER par jeu de données
Taux d'erreur par mot et par caractère pour chaque jeu de données. Plus bas c'est mieux — et ce sont les vrais chiffres de Whisper large-v3-turbo, qui sont faibles sur Common Voice 24.
Résumé par jeu de données
Précision, vitesse et temps agrégés pour chaque jeu de données.
| Jeu de données | Source | Échantillons | Réussite | WER | CER | Précision | Vitesse | Audio (s) | Trait. (s) |
|---|---|---|---|---|---|---|---|---|---|
| Common Voice 24 (MN) | Hugging Face → | 59 | 59/59 | 100.3% | 56.2% | -0.3% | 0.86× | 330.6s | 382.6s |
| Shunya Labs Mongolian Speech | Hugging Face → | 60 | 60/60 | 99.4% | 47.7% | 0.6% | 1.01× | 645.1s | 640.2s |
| Common Voice 20 (MN) | Hugging Face → | 54 | 54/54 | 101% | 58.1% | -1.0% | 0.55× | 269.8s | 489.7s |
| Modern Voice | — | 92 | 92/92 | 96.8% | 55.6% | 3.2% | 1.18× | 603.8s | 513.8s |
WER vs vitesse — par échantillon
Chaque point est un échantillon audio. L'idéal est en bas à gauche (peu d'erreurs, rapide). Whisper large-v3-turbo a un taux d'erreur élevé sur de nombreux échantillons Common Voice 24.
Résultats par échantillon
La vérité terrain est affichée telle quelle dans la colonne Attendu. La colonne de résultat surligne en rouge uniquement les mots que Whisper large-v3-turbo a ratés — pas de ratures ni d'échanges, juste les erreurs.
| # | Audio | Échantillon | Jeu de données | Attendu (vérité terrain) | Résultat Whisper large-v3-turbo | WER | CER | I/D/S |
|---|---|---|---|---|---|---|---|---|
| 1 | btsee_0001 | Common Voice 24 (MN) | Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье. | Дээ амсхалд бараа бээхэээ тэндэ мэдэжэээгээээ хэлэээ. | 100.0% | 56.9% | 0/1/7 | |
| 2 | btsee_0002 | Common Voice 24 (MN) | Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү? | нады заясан аджырғалгеттэгэртэ құрыққын сарай құтсаттэ бәсэнгэ чуэл | 100.0% | 54.7% | 0/4/8 | |
| 3 | btsee_0003 | Common Voice 24 (MN) | Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе. | Одо дэ дүр стөл чин рэгэсэсэлэй чэцгэй | 100.0% | 51.9% | 0/0/7 | |
| 4 | btsee_0004 | Common Voice 24 (MN) | Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн. | Би боз қолтүү хэрэр гэр цэр дэр хий жабдэг хүн | 60.0% | 29.4% | 0/0/6 | |
| 5 | btsee_0005 | Common Voice 24 (MN) | Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ. | Hann formast orðlas boltgu, borðu hún hærð, þógar, neyrgur fyrir og sér. | 120.0% | 92.2% | 2/0/10 | |
| 6 | btsee_0006 | Common Voice 24 (MN) | Алив наашаа ороод ир гээд гэртээ оров. | Эсфина þessi орður, get gist í orð. | 100.0% | 83.8% | 0/0/7 | |
| 7 | btsee_0007 | Common Voice 24 (MN) | Өө өндөр дээдэс таны тухайд би баталж чадахгүй. | Уүндөрдээд тэний түхээд би бодал чадагүй. | 87.5% | 37.0% | 0/2/5 | |
| 8 | btsee_0008 | Common Voice 24 (MN) | Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв. | хараан горубтойг үудагаас сай кайлиң хүнүүсыйг сан рэх бэг келл ў. | 137.5% | 62.5% | 3/0/8 | |
| 9 | btsee_0009 | Common Voice 24 (MN) | Та нар очингуутаа шөл л өгч үз. | Танар отжунгута шүлэл ўүтжүт. | 100.0% | 43.3% | 0/3/4 | |
| 10 | btsee_0010 | Common Voice 24 (MN) | Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь. | Ёрөз үлтурэсэй салагы афсэймчэн. | 100.0% | 58.3% | 0/3/4 |
Méthodologie
Comment ces chiffres ont été obtenus.
Fournisseur : Whisper large-v3-turbo (Whisper large-v3-turbo open weights (4 decoder layers) run locally — the speed-optimised distillation of large-v3.).
Endpoint local (transformers). Langue mn. Point de fonctionnement openai/whisper-large-v3-turbo (language=mn, task=transcribe) on mps. Diariatisation none.
Jeux de données : Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 échantillons, 1849.3s d'audio au total.
- Common Voice 24 (MN)https://huggingface.co/datasets/btsee/common-voices-24-mn
- Shunya Labs Mongolian Speechhttps://huggingface.co/datasets/shunyalabs/mongolian-speech-dataset
- Common Voice 20 (MN)https://huggingface.co/datasets/warmestman/common-voice-20-mn-normalized
- Modern Voice—
Métriques : WER et CER sont calculés avec un alignement Levenshtein mots/caractères standard, normalisé sur la casse et la ponctuation. Précision = 100 − WER. Facteur de vitesse = durée audio ÷ temps de traitement (× temps réel). Toutes les requêtes sont de vrais appels à la Batch API de Whisper large-v3-turbo, ni en cache ni simulés.
Surlignage des différences : La colonne de résultat est alignée sur la vérité terrain et colore en rouge chaque substitution et insertion. Les suppressions (mots manquants dans le résultat) ne sont pas affichées dans la colonne de résultat — la colonne Attendu contient déjà toute la vérité terrain telle quelle.