Google STT — మంగోలియన్ స్పీచ్-టు-టెక్స్ట్ బెంచ్మార్క్
Google STT Batch API (మెరుగైన ఆపరేటింగ్ పాయింట్, భాష mn-MN) ద్వారా 4 మంగోలియన్ డేటాసెట్లు మరియు 265 ఆడియో నమూనాలపై అంచనా వేసిన వాస్తవ ఫలితాలు. కింద ప్రతి సంఖ్య కొలిచినదే — మార్కెటింగ్ కాదు. WER, వేగం మరియు ధర అలాగే, కఠినమైన నిజాయితీతో చూపబడ్డాయి.
265/265 నమూనాలు ట్రాన్స్క్రైబ్ అయ్యాయి · 100% విజయం
తక్కువ మంచిది · 265 నమూనాలపై
ధర
బ్యాచ్ ట్రాన్స్క్రిప్షన్ కోసం Google STT జాబితా ధర. లాభాలు లేవు లేదా చర్చించిన రేట్లు లేవు — నిమిషానికి ముడి రేటు.
ధర మూలం: Google STT పబ్లిక్ ధరలు. Duudlaga Flow కేవలం సందర్భం కోసం చూపబడింది — ఈ పేజీ Google STT ను వేరు చేస్తుంది తద్వారా సంఖ్య మన ఉత్పత్తి ద్వారా పెంచబడదు.
డేటాసెట్ వారీ WER మరియు CER
డేటాసెట్ వారీ పద మరియు అక్షర పొరపాటు రేట్లు. తక్కువ మంచిది — మరియు ఇవి Google STT యొక్క వాస్తవ సంఖ్యలు, అవి Common Voice 24 పై బలహీనంగా ఉన్నాయి.
డేటాసెట్ సారాంశం
ప్రతి డేటాసెట్ కోసం సముదాయ ఖచ్చితత్వం, వేగం మరియు సమయం.
| డేటాసెట్ | Source | నమూనాలు | విజయం | WER | CER | ఖచ్చితత్వం | వేగం | ఆడియో (సె) | ప్రాసె. (సె) |
|---|---|---|---|---|---|---|---|---|---|
| Common Voice 24 (MN) | Hugging Face → | 59 | 59/59 | 16.7% | 6% | 83.3% | 2.03× | —s | —s |
| Shunya Labs Mongolian Speech | Hugging Face → | 60 | 60/60 | 10.5% | 4% | 89.5% | 2.45× | —s | —s |
| Common Voice 20 (MN) | Hugging Face → | 54 | 54/54 | 21.3% | 8.7% | 78.7% | 1.44× | —s | —s |
| Modern Voice | — | 92 | 92/92 | 18.7% | 9.9% | 81.3% | 2.06× | 603.8s | 293s |
WER vs వేగం — నమూనా వారీ
ప్రతి బిందువు ఒక ఆడియో నమూనా. సరైన స్థానం కింద-ఎడమ (తక్కువ పొరపాటు, వేగం). Google STT అనేక Common Voice 24 నమూనాలపై అధిక పొరపాటు కలిగి ఉంది.
నమూనా వారీ ఫలితాలు
అనుకున్న కాలమ్లో గ్రౌండ్ ట్రూత్ అలాగే చూపబడింది. ఫలితాల కాలమ్ Google STT తప్పు చేసిన పదాలను మాత్రమే ఎరుపు రంగులో హైలైట్ చేస్తుంది — స్ట్రైక్థ్రూ/మార్పిడి లేదు, కేవలం తప్పులు.
| # | ఆడియో | నమూనా | డేటాసెట్ | అనుకున్న (గ్రౌండ్ ట్రూత్) | Google STT ఫలితం | WER | CER | I/D/S |
|---|---|---|---|---|---|---|---|---|
| 1 | btsee-cv24-mn-0001 | Common Voice 24 (MN) | Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье. | Гэхдээ амьсгал хураахаасаа өмнө танд мэдэж байгаагаа хэлье. | 0.0% | 0.0% | 0/0/0 | |
| 2 | btsee-cv24-mn-0002 | Common Voice 24 (MN) | Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү? | Надад заяасан аз жаргал гэдэг ердөө гуравхан сарын хугацаатай байсан гэж үү? | 0.0% | 0.0% | 0/0/0 | |
| 3 | btsee-cv24-mn-0003 | Common Voice 24 (MN) | Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе. | Одоо бид өөрсдөө өвчин эмгэгээсээ салахыг хичээцгээе. | 0.0% | 0.0% | 0/0/0 | |
| 4 | btsee-cv24-mn-0004 | Common Voice 24 (MN) | Би бол голдуу хээрээр гэр, хэцээр дэр хийж явдаг хүн. | Би бол голдуу хээрээр гэр хэцээр дэр хийж явдаг хүн. | 0.0% | 0.0% | 0/0/0 | |
| 5 | btsee-cv24-mn-0005 | Common Voice 24 (MN) | Хан хурмаст уурлаж, Болдоггүй Бор өвгөнийг хор луугаараа ниргүүлэхээр явуулжээ. | Хаан Хормистуусын болтугай баруун хоёр дахь луугаар нэргүүлэхээр явжээ. | 100.0% | 41.6% | 0/1/9 | |
| 6 | btsee-cv24-mn-0006 | Common Voice 24 (MN) | Алив наашаа ороод ир гээд гэртээ оров. | Алив наашаа ороод ир гээд гэртээ оров. | 0.0% | 0.0% | 0/0/0 | |
| 7 | btsee-cv24-mn-0007 | Common Voice 24 (MN) | Өө өндөр дээдэс таны тухайд би баталж чадахгүй. | Өө, өндөр дээдэс, таны тухайд би баталж чадахгүй. | 0.0% | 0.0% | 0/0/0 | |
| 8 | btsee-cv24-mn-0008 | Common Voice 24 (MN) | Харин гурав дахь удаагаас эхлэн хүмүүсийг сонирхож эхлэв. | Харин гурав дахь удаагаасаа эхлэн хүмүүсийг сонирхож эхлэв. | 12.5% | 3.6% | 0/0/1 | |
| 9 | btsee-cv24-mn-0009 | Common Voice 24 (MN) | Та нар очингуутаа шөл л өгч үз. | Та нар очингуутаа шүлэл өгч үз. | 28.6% | 6.7% | 0/1/1 | |
| 10 | btsee-cv24-mn-0010 | Common Voice 24 (MN) | Ерөөсөө литр үйлдвэрээсээ салаагүй явсан юм чинь. | Ерөөсөө л үйлдвэрээсээ салаагүй явсан юм чинь. | 14.3% | 6.2% | 0/0/1 |
పద్ధతిశాస్త్రం
ఈ సంఖ్యలు ఎలా వచ్చాయి.
ప్రొవైడర్: Google STT (Google Cloud Speech-to-Text V2 raw transcription.).
ఎండ్పాయింట్ http://localhost:8080/transcribe. భాష mn-MN. WER కోసం విరామ చిహ్నాలు తొలగించబడ్డాయి.
డేటాసెట్లు: Common Voice 24 (MN), Shunya Labs Mongolian Speech, Common Voice 20 (MN), Modern Voice — 265 నమూనాలు, మొత్తం 1849.3s ఆడియో.
- Common Voice 24 (MN)https://huggingface.co/datasets/btsee/common-voices-24-mn
- Shunya Labs Mongolian Speechhttps://huggingface.co/datasets/shunyalabs/mongolian-speech-dataset
- Common Voice 20 (MN)https://huggingface.co/datasets/warmestman/common-voice-20-mn-normalized
- Modern Voice—
మెట్రిక్స్: WER మరియు CER ప్రామాణిక పద/అక్షర లెవెన్స్టైన్ అలైన్మెంట్తో, కేసు మరియు పంక్చుయేషన్కు నార్మలైజ్ చేసి లెక్కించబడతాయి. ఖచ్చితత్వం = 100 − WER. వేగ గుణకం = ఆడియో నిడివి ÷ ప్రాసెసింగ్ సమయం (× రియల్-టైమ్). అన్ని అభ్యర్థనలు నిజమైన Google STT Batch API కాల్లు, క్యాషే లేదా సిమ్యులేటెడ్ కావు.
తేడా హైలైటింగ్: ఫలితాల కాలమ్ గ్రౌండ్ ట్రూత్తో అలైన్ అవుతుంది మరియు ప్రతి ప్రత్యామ్నాయం మరియు చొప్పింతను ఎరుపు రంగు చేస్తుంది. తొలగింపులు (ఫలితంలో లేని పదాలు) ఫలితాల కాలమ్లో చూపబడవు — అనుకున్న కాలమ్ ఇప్పటికే మొత్తం గ్రౌండ్ ట్రూత్ను అలాగే కలిగి ఉంది.