Faites OCR des centaines d’images en un seul passage : reçus, scans, captures d’écran, archives. Chaque image produit sa propre .txt, et le ZIP porte aussi un JSON combiné avec chaque ligne, sa position et sa confiance, prête à être consommée par un script.
Comment ça marche
- Publiez une image ou PDF. La détection de texte s’active immédiatement.
- Choisissez votre pack linguistique (téléchargé une fois, 8–17 Mo) et appuyez sur Lire le texte.
- Copiez les répliques, ou téléchargez .txt / .json. Les PDF se lisent de la première à la dernière page.
Questions fréquentes
- Combien de fichiers un lot peut-il prendre ?
- Jusqu’à 500 fichiers ou 2 Go d’entrée par exécution, déposés sous forme de fichiers non faits ou d’un seul ZIP. Les objets se traitent un par un sur votre appareil, rien n’est téléchargé, et la bande de progression affiche une date estimée par article. Tâches plus importantes : divisées en deux drops.
- Qu’est-ce que je reçois en retour ?
- Un ZIP: chaque fichier traité, nommé exactement comme le téléchargement d’un seul fichier, plus _report.txt et _report.json listant chaque entrée et ce qui lui est arrivé, y compris celles qui ont échoué et pourquoi. Un lot annulé télécharge toujours les articles terminés jusqu’à présent, le rapport le confirmant.
- Est-ce que mon fichier est téléchargé ?
- Non. Les modèles et tous les traitements s’exécutent dans votre navigateur sur votre propre appareil. Vous pouvez vérifier vous-même : ouvrez le DevTools de votre navigateur, surveillez l’onglet Réseau et traitez un fichier : il n’y a pas de téléchargements. Après la première visite, la plupart des outils fonctionnent aussi entièrement hors ligne.
- Quelles langues sont prises en charge ?
- 106 langues comprenant les écritures latine, cyrillique, arabe, devanagari, CJK, grecque, thaï, tamoule et télougou. Le bengali est le seul grand manque, puisqu’il n’existe pas encore de modèle v5 pour celui-ci, et le sélectionneur le dit plutôt que de deviner.
- Quelle est sa précision ?
- Sur un texte de document épuré, le taux d’erreur mesuré est inférieur à 2 %, et chaque ligne comporte un score de confiance pour que vous puissiez voir lesquelles vérifier. L’écriture manuscrite et les photos basse résolution se liraient pire.
- Est-ce qu’il lit les PDF numérisés ?
- Oui. Les PDF numériques sont lus depuis leur propre couche de texte, avec des caractères exacts aux positions exactes. Les pages numérisées passent par détection et reconnaissance, et les documents mixtes utilisent les deux.