Lesen Sie die Telugu-Schrift aus einem Bild. Telugu markiert Konsonantencluster, indem es eine Indexform des zweiten Konsonanten unter dem ersten schreibt, sodass sich Glyphen vertikal innerhalb einer Linie stapeln – was dieses Paket zu lesen ist und was ein allgemeines Modell falsch macht. Englisch auf derselben Seite wird vom gleichen 7,9-MB-Paket gelesen.
So funktioniert es
- Ein Bild oder PDF. Die Texterkennung läuft sofort.
- Wählen Sie Ihr Sprachpaket (einmal heruntergeladen, 8–17 MB) und drücken Sie auf Text lesen.
- Kopieren Sie die Zeilen oder laden Sie .txt / .json herunter. PDFs werden von Anfang bis Ende gelesen.
Häufige Fragen
- Verarbeitet es gestapelte Konsonantencluster?
- Ja – genau dieses Stacking ist der Grund, warum Telugu einen eigenen Erkennungsgerät braucht, anstatt einen mit einem anderen indischen Skript zu teilen. Die Ausgabe ist Unicode-Telugu, also wird sie in jeden Editor eingefügt, der die Schriftart enthält.
- Wird meine Datei hochgeladen?
- Nein. Die Modelle und die gesamte Verarbeitung laufen in deinem Browser auf deinem eigenen Gerät. Du kannst das selbst überprüfen: Öffne die DevTools deines Browsers, schau dir den Netzwerk-Tab an und bearbeite eine Datei: Es gibt keine Uploads. Nach dem ersten Besuch funktionieren die meisten Tools auch vollständig offline.
- Welche Sprachen werden unterstützt?
- 106 Sprachen in lateinischen, kyrillischen, arabischen, Devanagari, CJK, griechischen, thailändischen, tamilischen und teluguischen Schriften. Bengali ist die einzige große Lücke, da es dafür noch kein v5-Modell gibt und der Picker das sagt, anstatt zu raten.
- Wie genau ist das?
- Bei sauberem Dokumenttext liegt die gemessene Fehlerquote unter 2 %, und jede Zeile trägt einen Konfidenzwert, sodass man sehen kann, welche man überprüfen sollte. Handschrift und Fotos in niedriger Auflösung werden schlechter wirken.
- Liest es gescannte PDFs?
- Ja. Digitale PDFs werden von einer eigenen Textschicht aus gelesen, mit exakten Zeichen an exakten Stellen. Gescannte Seiten werden erkannt und erkannt, und gemischte Dokumente verwenden beides.