Mongolische Spracherkennungs-Bestenliste
Whisper medium MNArbeitspunkt: Cafet/whisper-meduim-mongolian (Mongolian fine-tune) on mps

Whisper medium MN — Benchmark für mongolische Spracherkennung

Echte Ergebnisse der Whisper medium MN Batch API (verbesserter Operating Point, Sprache mn), ausgewertet auf 4 mongolischen Datensätzen und 265 Audio-Samples. Alle Zahlen unten sind gemessen — keine Werbung. WER, Geschwindigkeit und Preis werden ungeschönt und brutal ehrlich gezeigt.

Sprache:MNDiarisierung:noneStichproben:265Lauf:Aug 18, 2026, 6:32 PMEndpoint:local (transformers)
06710077.5%
Genauigkeit

265/265 Samples transkribiert · 100 % Erfolg

06710022.5%
Wortfehlerrate

Niedriger ist besser · über 265 Samples

Kennzahlen
Zeichenfehlerrate8.9%
Ø Geschwindigkeitsfaktor2.7×Echtzeit-Vielfaches
Gesamt-Geschwindigkeitsfaktor2.7×
Ø Latenz pro Sample2.7s
Verarbeitetes Audio gesamt1849.3s30.8 Min.

Preis

Whisper medium MN-Listenpreis für Batch-Transkription. Keine Rabatte oder verhandelten Tarife — der rohe Preis pro Minute.

Pro 1000 Minuten
$0
Batch
Pro Minute
$0.0000
effektiv
Pro 1000 Min (diese 30.8 Min)
$0.00
würde kosten
Open Source?
proprietär

Preisquelle: öffentliche Preise von Whisper medium MN. Duudlaga Flow wird nur als Kontext gezeigt — diese Seite isoliert Whisper medium MN, damit die Zahl nicht durch unser eigenes Produkt aufgebläht wird.

WER & CER nach Datensatz

Wort- und Zeichenfehlerraten pro Datensatz. Niedriger ist besser — und dies sind die echten Whisper medium MN-Zahlen, die bei Common Voice 24 schwach sind.

Common Voice 24 (MN)
Quelldatensatz →
WER
9.9%
CER
3.2%
Shunya Labs Mongolian Speech
Quelldatensatz →
WER
2.8%
CER
1.5%
Common Voice 20 (MN)
Quelldatensatz →
WER
32.3%
CER
10.5%
Modern Voice
WER
37.7%
CER
16.3%
WERCER

Datensatz-Zusammenfassung

Aggregierte Genauigkeit, Geschwindigkeit und Zeitmessung je Datensatz.

DatensatzQuelleStichprobenErfolgWERCERGenauigkeitGeschwindigkeitAudio (s)Verarb. (s)
Common Voice 24 (MN)Hugging Face →5959/599.9%3.2%90.1%2.64×330.6s125.1s
Shunya Labs Mongolian SpeechHugging Face →6060/602.8%1.5%97.2%2.94×645.1s219.6s
Common Voice 20 (MN)Hugging Face →5454/5432.3%10.5%67.7%2.33×269.8s115.7s
Modern Voice9292/9237.7%16.3%62.3%2.68×603.8s225.4s

WER vs. Geschwindigkeit — pro Sample

Jeder Punkt ist ein Audio-Sample. Der Sweet Spot ist unten links (wenig Fehler, schnell). Whisper medium MN liegt bei vielen Common-Voice-24-Samples hoch im Fehler.

Ergebnisse pro Sample

Die Ground Truth wird in der Spalte „Erwartet“ unverändert gezeigt. Die Ergebnisspalte hebt nur die Wörter rot hervor, die Whisper medium MN falsch hatte — keine Durchstreich-Wechsel, nur die Fehler.

265 Zeilen
rotfalsches Wort im Ergebnisnormalkorrekt transkribiertDie Spalte „Erwartet“ wird unverändert als Ground Truth gezeigt
#AudioStichprobeDatensatzErwartet (Ground Truth)Whisper medium MN-ErgebnisWERCERI/D/S
1btsee_0001Common Voice 24 (MN)Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье.гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье0.0%0.0%0/0/0
2btsee_0002Common Voice 24 (MN)Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү?надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү0.0%0.0%0/0/0
3btsee_0003Common Voice 24 (MN)Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе.одоо бид өөрсдөө өвчин эмгээгүйсээ салахыг хичээцгээ28.6%7.7%0/0/2
4btsee_0004Common Voice 24 (MN)Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн.би бол голдуу хээрээр гэр хэцээр дэр хийж явдаг хүн0.0%0.0%0/0/0
5btsee_0005Common Voice 24 (MN)Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ.хан хурмаст уурлаж болдоггүй бор өвгөнийг хоёр луугаараа ниргүүлэхээр явуулжээ10.0%1.3%0/0/1
6btsee_0006Common Voice 24 (MN)Алив наашаа ороод ир гээд гэртээ оров.алив наашаа ороод ир гээд гэртээ оров0.0%0.0%0/0/0
7btsee_0007Common Voice 24 (MN)Өө өндөр дээдэс таны тухайд би баталж чадахгүй.өө өндөр дээдэс таны тухайд би баталж чадахгүй0.0%0.0%0/0/0
8btsee_0008Common Voice 24 (MN)Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.харин гурав дахь удаагаас эхлэх хүмүүсийг сонирхож эхлэв12.5%1.8%0/0/1
9btsee_0009Common Voice 24 (MN)Та нар очингуутаа шөл л өгч үз.та нар очингуутаа шөлөл өгч үз28.6%3.3%0/1/1
10btsee_0010Common Voice 24 (MN)Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь.ирвэс уйлдвэрлэсээ салаагүй явсан юм чинь42.9%25.0%0/1/2
Seite 1 von 27

Methodik

Wie diese Zahlen entstanden sind.

Anbieter: Whisper medium MN (Whisper medium fine-tuned for Mongolian on a private corpus — the second most-downloaded Mongolian Whisper fine-tune.). Modelle mit diesem Abzeichen wurden auf Daten trainiert, die sich mit den Benchmark-Korpora überschneiden (mongolisches Common Voice – 113 von 173 Stichproben – oder das öffentliche Shunya-Labs-Korpus). Werte auf überschneidenden Korpora sind durch Auswendiglernen überhöht; beurteilen Sie diese Modelle anhand der Tabelle je Datensatz auf ihrer Detailseite, besonders anhand der Korpora, auf denen sie NICHT trainiert wurden.

Endpoint local (transformers). Sprache mn. Arbeitspunkt Cafet/whisper-meduim-mongolian (Mongolian fine-tune) on mps. Diarisierung none.

Datensätze: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 Samples, insgesamt 1849.3s Audio.

Quell-URLs der Datensätze:

Kennzahlen: WER und CER werden mit einem Standard-Wort-/Zeichen-Levenshtein-Alignment berechnet, normalisiert für Groß-/Kleinschreibung und Zeichensetzung. Genauigkeit = 100 − WER. Geschwindigkeitsfaktor = Audiodauer ÷ Verarbeitungszeit (× Echtzeit). Alle Anfragen sind echte Whisper medium MN-Batch-API-Aufrufe, weder gecacht noch simuliert.

Diff-Hervorhebung: Die Ergebnisspalte wird an der Ground Truth ausgerichtet und färbt jede Substitution und Insertion rot. Deletionen (im Ergebnis fehlende Wörter) werden nicht in der Ergebnisspalte gezeigt — die Spalte „Erwartet“ enthält bereits die volle Ground Truth unverändert.

Erstellt vom Whisper medium MN Benchmark Runner · Whisper medium MN Batch API v2 · Lauf Aug 18, 2026, 6:32 PM