Mongoolse spraak-naar-tekst leaderboard
ElevenLabs Scribe v2Werkpunt: scribe_v2

ElevenLabs Scribe v2 — Benchmark voor Mongoolse spraak-naar-tekst

Echte resultaten van de ElevenLabs Scribe v2 Batch API (verbeterd operationeel punt, taal mn), geëvalueerd op 4 Mongoolse datasets en 265 audiosamples. Elk getal hieronder is gemeten — geen marketing. WER, snelheid en prijs worden getoond zoals ze zijn, brutaal eerlijk.

Taal:MNDiarisatie:noneMonsters:265Uitvoering:Aug 19, 2026, 6:13 PMEndpoint:https://api.elevenlabs.io/v1/speech-to-text
06710072.9%
Nauwkeurigheid

265/265 samples getranscribeerd · 100% succes

06710027.1%
Woordfoutpercentage

Lager is beter · over 265 samples

Kernmetrics
Tekenfoutpercentage10.6%
Gem. snelheidsfactor1.51×realtime veelvoud
Totale snelheidsfactor1.51×
Gem. latentie per sample4.7s
Totaal verwerkte audio1849.3s30.8 min

Prijs

ElevenLabs Scribe v2-lijstprijs voor batch-transcriptie. Geen kortingen of onderhandelde tarieven — het ruwe tarief per minuut.

Per 1000 minuten
$3.7
batch
Per minuut
$0.0037
effectief
Per 1000 min (deze 30.8 min)
$6.84
zou kosten
Open source?
propriëtair

Prijsbron: publieke prijzen van ElevenLabs Scribe v2. Duudlaga Flow wordt alleen ter context getoond — deze pagina isoleert ElevenLabs Scribe v2 zodat het getal niet wordt opgeblazen door ons eigen product.

WER en CER per dataset

Woord- en tekenfoutpercentages per dataset. Lager is beter — en dit zijn de echte ElevenLabs Scribe v2-cijfers, die zwak zijn op Common Voice 24.

Common Voice 24 (MN)
Brondataset →
WER
28.5%
CER
10.6%
Shunya Labs Mongolian Speech
Brondataset →
WER
19.2%
CER
6.3%
Common Voice 20 (MN)
Brondataset →
WER
29.4%
CER
11.4%
Modern Voice
WER
29.8%
CER
13%
WERCER

Overzicht per dataset

Geaggregeerde nauwkeurigheid, snelheid en timing per dataset.

DatasetBronMonstersSuccesWERCERNauwkeurigheidSnelheidAudio (s)Verw. (s)
Common Voice 24 (MN)Hugging Face →5959/5928.5%10.6%71.5%1.33×330.6s248.1s
Shunya Labs Mongolian SpeechHugging Face →6060/6019.2%6.3%80.8%1.74×645.1s370.3s
Common Voice 20 (MN)Hugging Face →5454/5429.4%11.4%70.6%1.41×269.8s190.7s
Modern Voice9292/9229.8%13%70.2%1.45×603.8s416s

WER vs. snelheid — per sample

Elke stip is één audiosample. De sweet spot is linksonder (weinig fouten, snel). ElevenLabs Scribe v2 scoort hoog op fouten bij veel Common Voice 24-samples.

Resultaten per sample

De ground truth wordt ongewijzigd getoond in de kolom Verwacht. De resultaatkolom markeert alleen de woorden die ElevenLabs Scribe v2 fout had in rood — geen doorhalingen of wissels, alleen de fouten.

265 rijen
roodfout woord in het resultaatnormaalcorrect getranscribeerdDe kolom Verwacht wordt ongewijzigd als ground truth getoond
#AudioMonsterDatasetVerwacht (ground truth)ElevenLabs Scribe v2-resultaatWERCERI/D/S
1btsee_0001Common Voice 24 (MN)Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье.Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье0.0%0.0%0/0/0
2btsee_0002Common Voice 24 (MN)Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү?Надад заяасан аж жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү?8.3%1.3%0/0/1
3btsee_0003Common Voice 24 (MN)Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе.Одоо бид өөрсдөө өвчин эмнэлгээсээ салахыг хичээцгээе.14.3%3.8%0/0/1
4btsee_0004Common Voice 24 (MN)Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн.Би бол голдуй хээрээр гэр, хэцээр дэр хийж явдаг хүн.10.0%2.0%0/0/1
5btsee_0005Common Voice 24 (MN)Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ.Хан хурмаст уулс болдоггүй бороо өгнө. Хоёр луугаар нэргүүлэхээр явагч70.0%26.0%0/0/7
6btsee_0006Common Voice 24 (MN)Алив наашаа ороод ир гээд гэртээ оров.Алив наашаа ороод ир гээд гэртээ оров.0.0%0.0%0/0/0
7btsee_0007Common Voice 24 (MN)Өө өндөр дээдэс таны тухайд би баталж чадахгүй.Өө, өндөр дээдс таны тухайд би ботолг чадахгүй25.0%8.7%0/0/2
8btsee_0008Common Voice 24 (MN)Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв.0.0%0.0%0/0/0
9btsee_0009Common Voice 24 (MN)Та нар очингуутаа шөл л өгч үз.Та нар очгондоо шүлэл өгч үз42.9%30.0%0/1/2
10btsee_0010Common Voice 24 (MN)Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь.Эрүүлсээл үйлдвэрээсээ салаагүй явсан юм чинь28.6%20.8%0/1/1
Pagina 1 van 27

Methodologie

Hoe deze getallen zijn verkregen.

Leverancier: ElevenLabs Scribe v2 (ElevenLabs Scribe v2 hosted transcription (language_code=mn).).

Endpoint https://api.elevenlabs.io/v1/speech-to-text. Taal mn. Werkpunt scribe_v2. Diarisatie none.

Datasets: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 samples, in totaal 1849.3s audio.

Bron-URL's van datasets:

Metrieken: WER en CER worden berekend met een standaard woord-/teken-Levenshtein-uitlijning, genormaliseerd voor hoofdletters en leestekens. Nauwkeurigheid = 100 − WER. Snelheidsfactor = audioduur ÷ verwerkingstijd (× realtime). Alle verzoeken zijn echte ElevenLabs Scribe v2-Batch-API-aanroepen, niet gecached of gesimuleerd.

Verschilmarkering: De resultaatkolom wordt uitgelijnd op de ground truth en kleurt elke substitutie en insertie rood. Deleties (woorden die ontbreken in het resultaat) worden niet in de resultaatkolom getoond — de kolom Verwacht bevat al de volledige ground truth ongewijzigd.

Gegenereerd door ElevenLabs Scribe v2 Benchmark Runner · ElevenLabs Scribe v2 Batch API v2 · uitvoering Aug 19, 2026, 6:13 PM