ElevenLabs Scribe v2 — Benchmark für mongolische Spracherkennung
Echte Ergebnisse der ElevenLabs Scribe v2 Batch API (verbesserter Operating Point, Sprache mn), ausgewertet auf 4 mongolischen Datensätzen und 265 Audio-Samples. Alle Zahlen unten sind gemessen — keine Werbung. WER, Geschwindigkeit und Preis werden ungeschönt und brutal ehrlich gezeigt.
265/265 Samples transkribiert · 100 % Erfolg
Niedriger ist besser · über 265 Samples
Preis
ElevenLabs Scribe v2-Listenpreis für Batch-Transkription. Keine Rabatte oder verhandelten Tarife — der rohe Preis pro Minute.
Preisquelle: öffentliche Preise von ElevenLabs Scribe v2. Duudlaga Flow wird nur als Kontext gezeigt — diese Seite isoliert ElevenLabs Scribe v2, damit die Zahl nicht durch unser eigenes Produkt aufgebläht wird.
WER & CER nach Datensatz
Wort- und Zeichenfehlerraten pro Datensatz. Niedriger ist besser — und dies sind die echten ElevenLabs Scribe v2-Zahlen, die bei Common Voice 24 schwach sind.
Datensatz-Zusammenfassung
Aggregierte Genauigkeit, Geschwindigkeit und Zeitmessung je Datensatz.
| Datensatz | Quelle | Stichproben | Erfolg | WER | CER | Genauigkeit | Geschwindigkeit | Audio (s) | Verarb. (s) |
|---|---|---|---|---|---|---|---|---|---|
| Common Voice 24 (MN) | Hugging Face → | 59 | 59/59 | 28.5% | 10.6% | 71.5% | 1.33× | 330.6s | 248.1s |
| Shunya Labs Mongolian Speech | Hugging Face → | 60 | 60/60 | 19.2% | 6.3% | 80.8% | 1.74× | 645.1s | 370.3s |
| Common Voice 20 (MN) | Hugging Face → | 54 | 54/54 | 29.4% | 11.4% | 70.6% | 1.41× | 269.8s | 190.7s |
| Modern Voice | — | 92 | 92/92 | 29.8% | 13% | 70.2% | 1.45× | 603.8s | 416s |
WER vs. Geschwindigkeit — pro Sample
Jeder Punkt ist ein Audio-Sample. Der Sweet Spot ist unten links (wenig Fehler, schnell). ElevenLabs Scribe v2 liegt bei vielen Common-Voice-24-Samples hoch im Fehler.
Ergebnisse pro Sample
Die Ground Truth wird in der Spalte „Erwartet“ unverändert gezeigt. Die Ergebnisspalte hebt nur die Wörter rot hervor, die ElevenLabs Scribe v2 falsch hatte — keine Durchstreich-Wechsel, nur die Fehler.
| # | Audio | Stichprobe | Datensatz | Erwartet (Ground Truth) | ElevenLabs Scribe v2-Ergebnis | WER | CER | I/D/S |
|---|---|---|---|---|---|---|---|---|
| 1 | btsee_0001 | Common Voice 24 (MN) | Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье. | Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье | 0.0% | 0.0% | 0/0/0 | |
| 2 | btsee_0002 | Common Voice 24 (MN) | Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү? | Надад заяасан аж жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү? | 8.3% | 1.3% | 0/0/1 | |
| 3 | btsee_0003 | Common Voice 24 (MN) | Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе. | Одоо бид өөрсдөө өвчин эмнэлгээсээ салахыг хичээцгээе. | 14.3% | 3.8% | 0/0/1 | |
| 4 | btsee_0004 | Common Voice 24 (MN) | Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн. | Би бол голдуй хээрээр гэр, хэцээр дэр хийж явдаг хүн. | 10.0% | 2.0% | 0/0/1 | |
| 5 | btsee_0005 | Common Voice 24 (MN) | Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ. | Хан хурмаст уулс болдоггүй бороо өгнө. Хоёр луугаар нэргүүлэхээр явагч | 70.0% | 26.0% | 0/0/7 | |
| 6 | btsee_0006 | Common Voice 24 (MN) | Алив наашаа ороод ир гээд гэртээ оров. | Алив наашаа ороод ир гээд гэртээ оров. | 0.0% | 0.0% | 0/0/0 | |
| 7 | btsee_0007 | Common Voice 24 (MN) | Өө өндөр дээдэс таны тухайд би баталж чадахгүй. | Өө, өндөр дээдс таны тухайд би ботолг чадахгүй | 25.0% | 8.7% | 0/0/2 | |
| 8 | btsee_0008 | Common Voice 24 (MN) | Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв. | Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв. | 0.0% | 0.0% | 0/0/0 | |
| 9 | btsee_0009 | Common Voice 24 (MN) | Та нар очингуутаа шөл л өгч үз. | Та нар очгондоо шүлэл өгч үз | 42.9% | 30.0% | 0/1/2 | |
| 10 | btsee_0010 | Common Voice 24 (MN) | Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь. | Эрүүлсээл үйлдвэрээсээ салаагүй явсан юм чинь | 28.6% | 20.8% | 0/1/1 |
Methodik
Wie diese Zahlen entstanden sind.
Anbieter: ElevenLabs Scribe v2 (ElevenLabs Scribe v2 hosted transcription (language_code=mn).).
Endpoint https://api.elevenlabs.io/v1/speech-to-text. Sprache mn. Arbeitspunkt scribe_v2. Diarisierung none.
Datensätze: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 Samples, insgesamt 1849.3s Audio.
- Common Voice 24 (MN)https://huggingface.co/datasets/btsee/common-voices-24-mn
- Shunya Labs Mongolian Speechhttps://huggingface.co/datasets/shunyalabs/mongolian-speech-dataset
- Common Voice 20 (MN)https://huggingface.co/datasets/warmestman/common-voice-20-mn-normalized
- Modern Voice—
Kennzahlen: WER und CER werden mit einem Standard-Wort-/Zeichen-Levenshtein-Alignment berechnet, normalisiert für Groß-/Kleinschreibung und Zeichensetzung. Genauigkeit = 100 − WER. Geschwindigkeitsfaktor = Audiodauer ÷ Verarbeitungszeit (× Echtzeit). Alle Anfragen sind echte ElevenLabs Scribe v2-Batch-API-Aufrufe, weder gecacht noch simuliert.
Diff-Hervorhebung: Die Ergebnisspalte wird an der Ground Truth ausgerichtet und färbt jede Substitution und Insertion rot. Deletionen (im Ergebnis fehlende Wörter) werden nicht in der Ergebnisspalte gezeigt — die Spalte „Erwartet“ enthält bereits die volle Ground Truth unverändert.