Mongolische Spracherkennungs-Bestenliste
Whisper turbo MNArbeitspunkt: Blgn94/whisper-large-v3-turbo-mn-lora (merged LoRA) on mps

Whisper turbo MN — Benchmark für mongolische Spracherkennung

Echte Ergebnisse der Whisper turbo MN Batch API (verbesserter Operating Point, Sprache mn), ausgewertet auf 4 mongolischen Datensätzen und 265 Audio-Samples. Alle Zahlen unten sind gemessen — keine Werbung. WER, Geschwindigkeit und Preis werden ungeschönt und brutal ehrlich gezeigt.

Sprache:MNDiarisierung:noneStichproben:265Lauf:Aug 18, 2026, 6:01 PMEndpoint:local (transformers)
06710074.3%
Genauigkeit

265/265 Samples transkribiert · 100 % Erfolg

06710025.7%
Wortfehlerrate

Niedriger ist besser · über 265 Samples

Kennzahlen
Zeichenfehlerrate9.2%
Ø Geschwindigkeitsfaktor2.43×Echtzeit-Vielfaches
Gesamt-Geschwindigkeitsfaktor2.43×
Ø Latenz pro Sample3.0s
Verarbeitetes Audio gesamt1849.3s30.8 Min.

Preis

Whisper turbo MN-Listenpreis für Batch-Transkription. Keine Rabatte oder verhandelten Tarife — der rohe Preis pro Minute.

Pro 1000 Minuten
$0
Batch
Pro Minute
$0.0000
effektiv
Pro 1000 Min (diese 30.8 Min)
$0.00
würde kosten
Open Source?
proprietär

Preisquelle: öffentliche Preise von Whisper turbo MN. Duudlaga Flow wird nur als Kontext gezeigt — diese Seite isoliert Whisper turbo MN, damit die Zahl nicht durch unser eigenes Produkt aufgebläht wird.

WER & CER nach Datensatz

Wort- und Zeichenfehlerraten pro Datensatz. Niedriger ist besser — und dies sind die echten Whisper turbo MN-Zahlen, die bei Common Voice 24 schwach sind.

Common Voice 24 (MN)
Quelldatensatz →
WER
18%
CER
6%
Shunya Labs Mongolian Speech
Quelldatensatz →
WER
17%
CER
4.7%
Common Voice 20 (MN)
Quelldatensatz →
WER
19.1%
CER
6.8%
Modern Voice
WER
40.1%
CER
15.7%
WERCER

Datensatz-Zusammenfassung

Aggregierte Genauigkeit, Geschwindigkeit und Zeitmessung je Datensatz.

DatensatzQuelleStichprobenErfolgWERCERGenauigkeitGeschwindigkeitAudio (s)Verarb. (s)
Common Voice 24 (MN)Hugging Face →5959/5918%6%82.0%1.98×330.6s167.1s
Shunya Labs Mongolian SpeechHugging Face →6060/6017%4.7%83.0%2.9×645.1s222.3s
Common Voice 20 (MN)Hugging Face →5454/5419.1%6.8%80.9%1.99×269.8s135.9s
Modern Voice9292/9240.1%15.7%59.9%2.56×603.8s235.9s

WER vs. Geschwindigkeit — pro Sample

Jeder Punkt ist ein Audio-Sample. Der Sweet Spot ist unten links (wenig Fehler, schnell). Whisper turbo MN liegt bei vielen Common-Voice-24-Samples hoch im Fehler.

Ergebnisse pro Sample

Die Ground Truth wird in der Spalte „Erwartet“ unverändert gezeigt. Die Ergebnisspalte hebt nur die Wörter rot hervor, die Whisper turbo MN falsch hatte — keine Durchstreich-Wechsel, nur die Fehler.

265 Zeilen
rotfalsches Wort im Ergebnisnormalkorrekt transkribiertDie Spalte „Erwartet“ wird unverändert als Ground Truth gezeigt
#AudioStichprobeDatensatzErwartet (Ground Truth)Whisper turbo MN-ErgebnisWERCERI/D/S
1btsee_0001Common Voice 24 (MN)Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье.Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье.0.0%0.0%0/0/0
2btsee_0002Common Voice 24 (MN)Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү?Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү?0.0%0.0%0/0/0
3btsee_0003Common Voice 24 (MN)Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе.Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе.0.0%0.0%0/0/0
4btsee_0004Common Voice 24 (MN)Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн.Би бол голдуу хээрээр гэр хэцээр дэр хийж явдаг хүн.0.0%0.0%0/0/0
5btsee_0005Common Voice 24 (MN)Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ.Хан хурмаст уурлаас Болдоггүй Бор өгнөө хоёр луугаар нэргүүлэхээр явуулжээ.50.0%14.3%0/0/5
6btsee_0006Common Voice 24 (MN)Алив наашаа ороод ир гээд гэртээ оров.Алив наашаа ороод ир гэээд гэртээ оров.14.3%2.7%0/0/1
7btsee_0007Common Voice 24 (MN)Өө өндөр дээдэс таны тухайд би баталж чадахгүй.Өө өндөр дээдэс таны тухайд би бодол ч чадахгүй.25.0%10.9%1/0/1
8btsee_0008Common Voice 24 (MN)Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.0.0%0.0%0/0/0
9btsee_0009Common Voice 24 (MN)Та нар очингуутаа шөл л өгч үз.Та нар очингуутаа шүл л өгч биз.28.6%10.0%0/0/2
10btsee_0010Common Voice 24 (MN)Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь.Ерөөсөө л үйлдвэрээсээ салаагүй явсан юм чинь.14.3%6.2%0/0/1
Seite 1 von 27

Methodik

Wie diese Zahlen entstanden sind.

Anbieter: Whisper turbo MN (Whisper large-v3-turbo fine-tuned on Mongolian Common Voice + FLEURS (LoRA merged into the base weights) — the most recent Mongolian adaptation of a current-generation Whisper.). Modelle mit diesem Abzeichen wurden auf Daten trainiert, die sich mit den Benchmark-Korpora überschneiden (mongolisches Common Voice – 113 von 173 Stichproben – oder das öffentliche Shunya-Labs-Korpus). Werte auf überschneidenden Korpora sind durch Auswendiglernen überhöht; beurteilen Sie diese Modelle anhand der Tabelle je Datensatz auf ihrer Detailseite, besonders anhand der Korpora, auf denen sie NICHT trainiert wurden.

Endpoint local (transformers). Sprache mn. Arbeitspunkt Blgn94/whisper-large-v3-turbo-mn-lora (merged LoRA) on mps. Diarisierung none.

Datensätze: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 Samples, insgesamt 1849.3s Audio.

Quell-URLs der Datensätze:

Kennzahlen: WER und CER werden mit einem Standard-Wort-/Zeichen-Levenshtein-Alignment berechnet, normalisiert für Groß-/Kleinschreibung und Zeichensetzung. Genauigkeit = 100 − WER. Geschwindigkeitsfaktor = Audiodauer ÷ Verarbeitungszeit (× Echtzeit). Alle Anfragen sind echte Whisper turbo MN-Batch-API-Aufrufe, weder gecacht noch simuliert.

Diff-Hervorhebung: Die Ergebnisspalte wird an der Ground Truth ausgerichtet und färbt jede Substitution und Insertion rot. Deletionen (im Ergebnis fehlende Wörter) werden nicht in der Ergebnisspalte gezeigt — die Spalte „Erwartet“ enthält bereits die volle Ground Truth unverändert.

Erstellt vom Whisper turbo MN Benchmark Runner · Whisper turbo MN Batch API v2 · Lauf Aug 18, 2026, 6:01 PM