Lesen Sie Spanisch von einem Foto, Scan oder Screenshot, mit betonten Vokalen, ñ und invertiert – wie gewöhnliche Zeichen und nicht weggelassen. Ein 8-MB-Modell deckt 47 lateinische Sprachen ab – Französisch, Deutsch, Portugiesisch, Italienisch, Niederländisch, Polnisch, Türkisch, Vietnamesisch und mehr –, sodass ein Dokument, das zwischen ihnen wechselt, immer noch ein Durchgang ist.
So funktioniert es
- Ein Bild oder PDF. Die Texterkennung läuft sofort.
- Wählen Sie Ihr Sprachpaket (einmal heruntergeladen, 8–17 MB) und drücken Sie auf Text lesen.
- Kopieren Sie die Zeilen oder laden Sie .txt / .json herunter. PDFs werden von Anfang bis Ende gelesen.
Häufige Fragen
- Ist das dasselbe Modell wie französische oder deutsche OCR?
- Ja. PaddleOCR trainiert pro SCRIPT einen Erkenner, nicht pro Sprache, und alle 47 lateinischen Schriftsprachen teilen sich dieses 8-MB-Paket. Deshalb gibt es dafür eine Seite statt 47 nahezu identischer – für jede davon sind Sie bereits auf der richtigen Seite.
- Wird meine Datei hochgeladen?
- Nein. Die Modelle und die gesamte Verarbeitung laufen in deinem Browser auf deinem eigenen Gerät. Du kannst das selbst überprüfen: Öffne die DevTools deines Browsers, schau dir den Netzwerk-Tab an und bearbeite eine Datei: Es gibt keine Uploads. Nach dem ersten Besuch funktionieren die meisten Tools auch vollständig offline.
- Welche Sprachen werden unterstützt?
- 106 Sprachen in lateinischen, kyrillischen, arabischen, Devanagari, CJK, griechischen, thailändischen, tamilischen und teluguischen Schriften. Bengali ist die einzige große Lücke, da es dafür noch kein v5-Modell gibt und der Picker das sagt, anstatt zu raten.
- Wie genau ist das?
- Bei sauberem Dokumenttext liegt die gemessene Fehlerquote unter 2 %, und jede Zeile trägt einen Konfidenzwert, sodass man sehen kann, welche man überprüfen sollte. Handschrift und Fotos in niedriger Auflösung werden schlechter wirken.
- Liest es gescannte PDFs?
- Ja. Digitale PDFs werden von einer eigenen Textschicht aus gelesen, mit exakten Zeichen an exakten Stellen. Gescannte Seiten werden erkannt und erkannt, und gemischte Dokumente verwenden beides.