Lee español a partir de una foto, escaneo o captura de pantalla, con vocales acentuadas, - e invertida — tratadas como caracteres ordinarios en lugar de eliminadas. Un modelo de 8 MB cubre 47 idiomas de alfabeto latino — francés, alemán, portugués, italiano, neerlandés, polaco, turco, vietnamita y más — por lo que un documento que cambia entre ellos sigue siendo una sola pasada.
Cómo funciona
- Deja una imagen o PDF. La detección de texto se ejecuta inmediatamente.
- Elige tu paquete de idiomas (descargado una vez, 8–17 MB) y pulsa Leer texto.
- Copia las líneas o descarga .txt / .json. Los PDFs se leen de principio a fin.
Preguntas frecuentes
- ¿Es este el mismo modelo que el OCR francés o alemán?
- Sí. PaddleOCR entrena un reconocedor por SCRIPT, no por idioma, y los 47 idiomas con alfabeto latino comparten este paquete de 8 MB. Por eso hay una página para ella en lugar de 47 casi idénticas — ya estás en la página correcta para cualquiera de ellas.
- ¿Mi archivo se sube?
- No. Los modelos y todo el procesamiento se ejecutan dentro de tu navegador en tu propio dispositivo. Puedes comprobarlo tú mismo: abre la DevTools de tu navegador, mira la pestaña de Red y procesa un archivo: no hay subidas. Después de la primera visita, la mayoría de las herramientas también funcionan completamente offline.
- ¿Qué lenguajes están soportados?
- 106 idiomas en latín, cirílico, árabe, devanagari, CJK, griego, tailandés, tamil y telugu. El bengalí es la única gran diferencia, ya que aún no existe un modelo v5 para él, y el seleccionador lo dice en lugar de adivinar.
- ¿Qué tan precisa es?
- En texto limpio de documentos, la tasa de error de caracteres medida es inferior al 2%, y cada línea lleva una puntuación de confianza para que puedas ver cuáles debes comprobar. La caligrafía y las fotos de baja resolución se leen peor.
- ¿Lee PDFs escaneados?
- Sí. Los PDFs digitales se leen desde su propia capa de texto, con caracteres exactos en posiciones exactas. Las páginas escaneadas pasan por detección y reconocimiento, y los documentos mixtos usan ambos.