ElevenLabs Scribe v1 — Benchmark für mongolische Spracherkennung
Echte Ergebnisse der ElevenLabs Scribe v1 Batch API (verbesserter Operating Point, Sprache mn), ausgewertet auf 4 mongolischen Datensätzen und 265 Audio-Samples. Alle Zahlen unten sind gemessen — keine Werbung. WER, Geschwindigkeit und Preis werden ungeschönt und brutal ehrlich gezeigt.
265/265 Samples transkribiert · 100 % Erfolg
Niedriger ist besser · über 265 Samples
Preis
ElevenLabs Scribe v1-Listenpreis für Batch-Transkription. Keine Rabatte oder verhandelten Tarife — der rohe Preis pro Minute.
Preisquelle: öffentliche Preise von ElevenLabs Scribe v1. Duudlaga Flow wird nur als Kontext gezeigt — diese Seite isoliert ElevenLabs Scribe v1, damit die Zahl nicht durch unser eigenes Produkt aufgebläht wird.
WER & CER nach Datensatz
Wort- und Zeichenfehlerraten pro Datensatz. Niedriger ist besser — und dies sind die echten ElevenLabs Scribe v1-Zahlen, die bei Common Voice 24 schwach sind.
Datensatz-Zusammenfassung
Aggregierte Genauigkeit, Geschwindigkeit und Zeitmessung je Datensatz.
| Datensatz | Quelle | Stichproben | Erfolg | WER | CER | Genauigkeit | Geschwindigkeit | Audio (s) | Verarb. (s) |
|---|---|---|---|---|---|---|---|---|---|
| Common Voice 24 (MN) | Hugging Face → | 59 | 59/59 | 30% | 10.9% | 70.0% | 2.35× | 330.6s | 140.9s |
| Shunya Labs Mongolian Speech | Hugging Face → | 60 | 60/60 | 18.7% | 5.9% | 81.3% | 2.02× | 645.1s | 319.9s |
| Common Voice 20 (MN) | Hugging Face → | 54 | 54/54 | 31.3% | 13.1% | 68.7% | 2.41× | 269.8s | 111.8s |
| Modern Voice | — | 92 | 92/92 | 28.3% | 12.4% | 71.7% | 2.06× | 603.8s | 293.2s |
WER vs. Geschwindigkeit — pro Sample
Jeder Punkt ist ein Audio-Sample. Der Sweet Spot ist unten links (wenig Fehler, schnell). ElevenLabs Scribe v1 liegt bei vielen Common-Voice-24-Samples hoch im Fehler.
Ergebnisse pro Sample
Die Ground Truth wird in der Spalte „Erwartet“ unverändert gezeigt. Die Ergebnisspalte hebt nur die Wörter rot hervor, die ElevenLabs Scribe v1 falsch hatte — keine Durchstreich-Wechsel, nur die Fehler.
| # | Audio | Stichprobe | Datensatz | Erwartet (Ground Truth) | ElevenLabs Scribe v1-Ergebnis | WER | CER | I/D/S |
|---|---|---|---|---|---|---|---|---|
| 1 | btsee_0001 | Common Voice 24 (MN) | Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье. | Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье | 0.0% | 0.0% | 0/0/0 | |
| 2 | btsee_0002 | Common Voice 24 (MN) | Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү? | Надад заяасан аж чиргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү? | 16.7% | 4.0% | 0/0/2 | |
| 3 | btsee_0003 | Common Voice 24 (MN) | Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе. | Одоо бид өөрсдөө өвчийн эмнэлгээсээ салхийг хичээцгээе. | 42.9% | 11.5% | 0/0/3 | |
| 4 | btsee_0004 | Common Voice 24 (MN) | Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн. | Би бол голдуй хээрээр гэр, хицээр дэр хийж явдаг хүн | 20.0% | 3.9% | 0/0/2 | |
| 5 | btsee_0005 | Common Voice 24 (MN) | Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ. | Хан хурмаст уулзсан болдоггүй бор өвгөнө хоёр луугаар нэргүүлэхээр явагджээ | 60.0% | 18.2% | 0/0/6 | |
| 6 | btsee_0006 | Common Voice 24 (MN) | Алив наашаа ороод ир гээд гэртээ оров. | Алив наашаа ороод ир гээд гэртээ оров. | 0.0% | 0.0% | 0/0/0 | |
| 7 | btsee_0007 | Common Voice 24 (MN) | Өө өндөр дээдэс таны тухайд би баталж чадахгүй. | Өө, өндөр дээдс таны тухайд би бодол ч чадахгүй | 37.5% | 13.0% | 1/0/2 | |
| 8 | btsee_0008 | Common Voice 24 (MN) | Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв. | Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв. | 0.0% | 0.0% | 0/0/0 | |
| 9 | btsee_0009 | Common Voice 24 (MN) | Та нар очингуутаа шөл л өгч үз. | Та нар очингуутаа шүлэл өгч үз | 28.6% | 6.7% | 0/1/1 | |
| 10 | btsee_0010 | Common Voice 24 (MN) | Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь. | Эрүүлсээл үйлдвэрээсээ салаагүй явсан юм чинь. | 28.6% | 20.8% | 0/1/1 |
Methodik
Wie diese Zahlen entstanden sind.
Anbieter: ElevenLabs Scribe v1 (ElevenLabs Scribe v1 hosted transcription (language_code=mn).).
Endpoint https://api.elevenlabs.io/v1/speech-to-text. Sprache mn. Arbeitspunkt scribe_v1. Diarisierung none.
Datensätze: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 Samples, insgesamt 1849.3s Audio.
- Common Voice 24 (MN)https://huggingface.co/datasets/btsee/common-voices-24-mn
- Shunya Labs Mongolian Speechhttps://huggingface.co/datasets/shunyalabs/mongolian-speech-dataset
- Common Voice 20 (MN)https://huggingface.co/datasets/warmestman/common-voice-20-mn-normalized
- Modern Voice—
Kennzahlen: WER und CER werden mit einem Standard-Wort-/Zeichen-Levenshtein-Alignment berechnet, normalisiert für Groß-/Kleinschreibung und Zeichensetzung. Genauigkeit = 100 − WER. Geschwindigkeitsfaktor = Audiodauer ÷ Verarbeitungszeit (× Echtzeit). Alle Anfragen sind echte ElevenLabs Scribe v1-Batch-API-Aufrufe, weder gecacht noch simuliert.
Diff-Hervorhebung: Die Ergebnisspalte wird an der Ground Truth ausgerichtet und färbt jede Substitution und Insertion rot. Deletionen (im Ergebnis fehlende Wörter) werden nicht in der Ergebnisspalte gezeigt — die Spalte „Erwartet“ enthält bereits die volle Ground Truth unverändert.