Извлечение текста из PDF

● 100% в браузере: ничего не загружается

Loading…

Извлечь текст из целого PDF, отсканированного или цифрового, не отправляя его никуда. Цифровые страницы считываются точно с текстового слоя; Отсканированные страницы проходят через встроенный OCR. Уберите текст как .txt или верните весь документ в виде поискового PDF , который выглядит точно так же, как оригинал.

Как это работает

  1. Оставьте изображение или PDF. Обнаружение текста запускается мгновенно.
  2. Выберите свой языковой пакет (скачано один раз, 8–17 МБ) и нажмите «Читать текст».
  3. Скопируйте строки или скачайте .txt / .json. PDF-файлы читаются от корки до корки.

Частые вопросы

Загружается ли мой файл?
Нет. Модели и вся обработка работают внутри вашего браузера на вашем устройстве. Вы можете проверить это сами: откройте DevToolsбраузера, посмотрите вкладку «Сеть» и обработайте файл: загрузок нет. После первого визита большинство инструментов работают полностью офлайн.
Какие языки поддерживаются?
106 языков по латинскому, кириллице, арабскому, деванагари, CJK, греческому, тайскому, тамильскому и телугу. Бенгальский — единственный серьёзный пробел, так как для него пока не существует модели v5, и пикер говорит об этом, а не догадывается.
Насколько это точно?
В чистом тексте документа уровень ошибки символов составляет менее 2%, и каждая строка содержит рейтинг доверия, чтобы вы могли видеть, какие именно стоит проверить. Почерк и фотографии низкого разрешения будут читаться хуже.
Он читает отсканированные PDF-файлы?
Да. Цифровые PDF читаются с собственного текстового слоя, где точные символы находятся в точных позициях. Отсканированные страницы проходят через обнаружение и распознавание, а смешанные документы используют оба метода.

Похожие инструменты