Lee chino a partir de una imagen — Simplificado y Tradicional, y el mismo paquete dice japonés e inglés, así que una página que mezcla los tres no necesita segunda lectura. Es el único pack entrenado con líneas verticales, caligrafía y pinyin, por eso también es el predeterminado: una captura de pantalla CJK en una visita reciente recibe una respuesta en lugar de mojibake. Con 16 MB, es el más grande de los doce.
Cómo funciona
- Deja una imagen o PDF. La detección de texto se ejecuta inmediatamente.
- Elige tu paquete de idiomas (descargado una vez, 8–17 MB) y pulsa Leer texto.
- Copia las líneas o descarga .txt / .json. Los PDFs se leen de principio a fin.
Preguntas frecuentes
- ¿Gestiona texto vertical y caligrafía?
- Sí — este paquete está entrenado con ambos, junto con anotaciones en pinyin. Las líneas verticales vuelven como líneas separadas en orden de lectura. La escritura a mano es más difícil que la impresa para cualquier modelo de OCR , así que revisa las puntuaciones de confianza por línea.
- ¿Mi archivo se sube?
- No. Los modelos y todo el procesamiento se ejecutan dentro de tu navegador en tu propio dispositivo. Puedes comprobarlo tú mismo: abre la DevTools de tu navegador, mira la pestaña de Red y procesa un archivo: no hay subidas. Después de la primera visita, la mayoría de las herramientas también funcionan completamente offline.
- ¿Qué lenguajes están soportados?
- 106 idiomas en latín, cirílico, árabe, devanagari, CJK, griego, tailandés, tamil y telugu. El bengalí es la única gran diferencia, ya que aún no existe un modelo v5 para él, y el seleccionador lo dice en lugar de adivinar.
- ¿Qué tan precisa es?
- En texto limpio de documentos, la tasa de error de caracteres medida es inferior al 2%, y cada línea lleva una puntuación de confianza para que puedas ver cuáles debes comprobar. La caligrafía y las fotos de baja resolución se leen peor.
- ¿Lee PDFs escaneados?
- Sí. Los PDFs digitales se leen desde su propia capa de texto, con caracteres exactos en posiciones exactas. Las páginas escaneadas pasan por detección y reconocimiento, y los documentos mixtos usan ambos.