Whisper medium MN — Benchmark für mongolische Spracherkennung
Echte Ergebnisse der Whisper medium MN Batch API (verbesserter Operating Point, Sprache mn), ausgewertet auf 4 mongolischen Datensätzen und 265 Audio-Samples. Alle Zahlen unten sind gemessen — keine Werbung. WER, Geschwindigkeit und Preis werden ungeschönt und brutal ehrlich gezeigt.
265/265 Samples transkribiert · 100 % Erfolg
Niedriger ist besser · über 265 Samples
Preis
Whisper medium MN-Listenpreis für Batch-Transkription. Keine Rabatte oder verhandelten Tarife — der rohe Preis pro Minute.
Preisquelle: öffentliche Preise von Whisper medium MN. Duudlaga Flow wird nur als Kontext gezeigt — diese Seite isoliert Whisper medium MN, damit die Zahl nicht durch unser eigenes Produkt aufgebläht wird.
WER & CER nach Datensatz
Wort- und Zeichenfehlerraten pro Datensatz. Niedriger ist besser — und dies sind die echten Whisper medium MN-Zahlen, die bei Common Voice 24 schwach sind.
Datensatz-Zusammenfassung
Aggregierte Genauigkeit, Geschwindigkeit und Zeitmessung je Datensatz.
| Datensatz | Quelle | Stichproben | Erfolg | WER | CER | Genauigkeit | Geschwindigkeit | Audio (s) | Verarb. (s) |
|---|---|---|---|---|---|---|---|---|---|
| Common Voice 24 (MN) | Hugging Face → | 59 | 59/59 | 9.9% | 3.2% | 90.1% | 2.64× | 330.6s | 125.1s |
| Shunya Labs Mongolian Speech | Hugging Face → | 60 | 60/60 | 2.8% | 1.5% | 97.2% | 2.94× | 645.1s | 219.6s |
| Common Voice 20 (MN) | Hugging Face → | 54 | 54/54 | 32.3% | 10.5% | 67.7% | 2.33× | 269.8s | 115.7s |
| Modern Voice | — | 92 | 92/92 | 37.7% | 16.3% | 62.3% | 2.68× | 603.8s | 225.4s |
WER vs. Geschwindigkeit — pro Sample
Jeder Punkt ist ein Audio-Sample. Der Sweet Spot ist unten links (wenig Fehler, schnell). Whisper medium MN liegt bei vielen Common-Voice-24-Samples hoch im Fehler.
Ergebnisse pro Sample
Die Ground Truth wird in der Spalte „Erwartet“ unverändert gezeigt. Die Ergebnisspalte hebt nur die Wörter rot hervor, die Whisper medium MN falsch hatte — keine Durchstreich-Wechsel, nur die Fehler.
| # | Audio | Stichprobe | Datensatz | Erwartet (Ground Truth) | Whisper medium MN-Ergebnis | WER | CER | I/D/S |
|---|---|---|---|---|---|---|---|---|
| 1 | btsee_0001 | Common Voice 24 (MN) | Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье. | гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье | 0.0% | 0.0% | 0/0/0 | |
| 2 | btsee_0002 | Common Voice 24 (MN) | Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү? | надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү | 0.0% | 0.0% | 0/0/0 | |
| 3 | btsee_0003 | Common Voice 24 (MN) | Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе. | одоо бид өөрсдөө өвчин эмгээгүйсээ салахыг хичээцгээ | 28.6% | 7.7% | 0/0/2 | |
| 4 | btsee_0004 | Common Voice 24 (MN) | Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн. | би бол голдуу хээрээр гэр хэцээр дэр хийж явдаг хүн | 0.0% | 0.0% | 0/0/0 | |
| 5 | btsee_0005 | Common Voice 24 (MN) | Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ. | хан хурмаст уурлаж болдоггүй бор өвгөнийг хоёр луугаараа ниргүүлэхээр явуулжээ | 10.0% | 1.3% | 0/0/1 | |
| 6 | btsee_0006 | Common Voice 24 (MN) | Алив наашаа ороод ир гээд гэртээ оров. | алив наашаа ороод ир гээд гэртээ оров | 0.0% | 0.0% | 0/0/0 | |
| 7 | btsee_0007 | Common Voice 24 (MN) | Өө өндөр дээдэс таны тухайд би баталж чадахгүй. | өө өндөр дээдэс таны тухайд би баталж чадахгүй | 0.0% | 0.0% | 0/0/0 | |
| 8 | btsee_0008 | Common Voice 24 (MN) | Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв. | харин гурав дахь удаагаас эхлэх хүмүүсийг сонирхож эхлэв | 12.5% | 1.8% | 0/0/1 | |
| 9 | btsee_0009 | Common Voice 24 (MN) | Та нар очингуутаа шөл л өгч үз. | та нар очингуутаа шөлөл өгч үз | 28.6% | 3.3% | 0/1/1 | |
| 10 | btsee_0010 | Common Voice 24 (MN) | Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь. | ирвэс уйлдвэрлэсээ салаагүй явсан юм чинь | 42.9% | 25.0% | 0/1/2 |
Methodik
Wie diese Zahlen entstanden sind.
Anbieter: Whisper medium MN (Whisper medium fine-tuned for Mongolian on a private corpus — the second most-downloaded Mongolian Whisper fine-tune.). Modelle mit diesem Abzeichen wurden auf Daten trainiert, die sich mit den Benchmark-Korpora überschneiden (mongolisches Common Voice – 113 von 173 Stichproben – oder das öffentliche Shunya-Labs-Korpus). Werte auf überschneidenden Korpora sind durch Auswendiglernen überhöht; beurteilen Sie diese Modelle anhand der Tabelle je Datensatz auf ihrer Detailseite, besonders anhand der Korpora, auf denen sie NICHT trainiert wurden.
Endpoint local (transformers). Sprache mn. Arbeitspunkt Cafet/whisper-meduim-mongolian (Mongolian fine-tune) on mps. Diarisierung none.
Datensätze: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 Samples, insgesamt 1849.3s Audio.
- Common Voice 24 (MN)https://huggingface.co/datasets/btsee/common-voices-24-mn
- Shunya Labs Mongolian Speechhttps://huggingface.co/datasets/shunyalabs/mongolian-speech-dataset
- Common Voice 20 (MN)https://huggingface.co/datasets/warmestman/common-voice-20-mn-normalized
- Modern Voice—
Kennzahlen: WER und CER werden mit einem Standard-Wort-/Zeichen-Levenshtein-Alignment berechnet, normalisiert für Groß-/Kleinschreibung und Zeichensetzung. Genauigkeit = 100 − WER. Geschwindigkeitsfaktor = Audiodauer ÷ Verarbeitungszeit (× Echtzeit). Alle Anfragen sind echte Whisper medium MN-Batch-API-Aufrufe, weder gecacht noch simuliert.
Diff-Hervorhebung: Die Ergebnisspalte wird an der Ground Truth ausgerichtet und färbt jede Substitution und Insertion rot. Deletionen (im Ergebnis fehlende Wörter) werden nicht in der Ergebnisspalte gezeigt — die Spalte „Erwartet“ enthält bereits die volle Ground Truth unverändert.