Тайский OCR

● 100% в браузере: ничего не загружается

Loading…

Читайте тайский язык по изображению. Тайский пишется без пробелов между словами и накладывает гласные и тональные метки выше и ниже согласной, поэтому строка тайского возвращается как непрерывный шрифт, а не разбивается на слова — то есть алфавит ведёт себя нормально, а не сбой распознавателя. Английский на той же странице тоже читается.

Как это работает

  1. Оставьте изображение или PDF. Обнаружение текста запускается мгновенно.
  2. Выберите свой языковой пакет (скачано один раз, 8–17 МБ) и нажмите «Читать текст».
  3. Скопируйте строки или скачайте .txt / .json. PDF-файлы читаются от корки до корки.

Частые вопросы

Почему между словами нет интервала?
Тайский не записывает пробелы между словами; пробелы отмечают концы предложений. Разбить тайскую строку на слова — это отдельная задача от чтения, а угадывания приведут к разрывам, которых нет в документе.
Загружается ли мой файл?
Нет. Модели и вся обработка работают внутри вашего браузера на вашем устройстве. Вы можете проверить это сами: откройте DevToolsбраузера, посмотрите вкладку «Сеть» и обработайте файл: загрузок нет. После первого визита большинство инструментов работают полностью офлайн.
Какие языки поддерживаются?
106 языков по латинскому, кириллице, арабскому, деванагари, CJK, греческому, тайскому, тамильскому и телугу. Бенгальский — единственный серьёзный пробел, так как для него пока не существует модели v5, и пикер говорит об этом, а не догадывается.
Насколько это точно?
В чистом тексте документа уровень ошибки символов составляет менее 2%, и каждая строка содержит рейтинг доверия, чтобы вы могли видеть, какие именно стоит проверить. Почерк и фотографии низкого разрешения будут читаться хуже.
Он читает отсканированные PDF-файлы?
Да. Цифровые PDF читаются с собственного текстового слоя, где точные символы находятся в точных позициях. Отсканированные страницы проходят через обнаружение и распознавание, а смешанные документы используют оба метода.

Похожие инструменты