Испанский OCR

● 100% в браузере: ничего не загружается

Loading…

Читайте испанский по фотографии, скану или скриншоту, с акцентированными гласными, ñ и перевёрнутыми ¿ ¡ обычными иероглифами, а не опущенными. Одна модель на 8 МБ охватывает 47 латинских языков — французский, немецкий, португальский, итальянский, голландский, польский, турецкий, вьетнамский и другие — так что документ, переключающийся между ними, всё равно считается одним проходом.

Как это работает

  1. Оставьте изображение или PDF. Обнаружение текста запускается мгновенно.
  2. Выберите свой языковой пакет (скачано один раз, 8–17 МБ) и нажмите «Читать текст».
  3. Скопируйте строки или скачайте .txt / .json. PDF-файлы читаются от корки до корки.

Частые вопросы

Это та же модель, что и французская или немецкая OCR?
Да. PaddleOCR обучает один распознаватель на каждый SCRIPT, а не на каждом языке, и все 47 латинских языков используют этот пакет объёмом 8 МБ. Вот почему для этого есть одна страница, а не 47 почти идентичных — вы уже на правильной странице для любой из них.
Загружается ли мой файл?
Нет. Модели и вся обработка работают внутри вашего браузера на вашем устройстве. Вы можете проверить это сами: откройте DevToolsбраузера, посмотрите вкладку «Сеть» и обработайте файл: загрузок нет. После первого визита большинство инструментов работают полностью офлайн.
Какие языки поддерживаются?
106 языков по латинскому, кириллице, арабскому, деванагари, CJK, греческому, тайскому, тамильскому и телугу. Бенгальский — единственный серьёзный пробел, так как для него пока не существует модели v5, и пикер говорит об этом, а не догадывается.
Насколько это точно?
В чистом тексте документа уровень ошибки символов составляет менее 2%, и каждая строка содержит рейтинг доверия, чтобы вы могли видеть, какие именно стоит проверить. Почерк и фотографии низкого разрешения будут читаться хуже.
Он читает отсканированные PDF-файлы?
Да. Цифровые PDF читаются с собственного текстового слоя, где точные символы находятся в точных позициях. Отсканированные страницы проходят через обнаружение и распознавание, а смешанные документы используют оба метода.

Похожие инструменты