Китайские OCR

● 100% в браузере: ничего не загружается

Loading…

Читайте китайский из изображения — упрощённый и традиционный, и в одном и том же наборе читается японский и английский, так что страница, смешивающая все три текста, не требует второго повторения. Это единственный набор, обученный на вертикальных линиях, почерке и пиньинь, поэтому он также является стандартным: CJK скриншот при свежем визите даёт ответ, а не mojibake. С объёмом 16 МБ он является самым крупным из двенадцати.

Как это работает

  1. Оставьте изображение или PDF. Обнаружение текста запускается мгновенно.
  2. Выберите свой языковой пакет (скачано один раз, 8–17 МБ) и нажмите «Читать текст».
  3. Скопируйте строки или скачайте .txt / .json. PDF-файлы читаются от корки до корки.

Частые вопросы

Он справляется с вертикальным текстом и рукописным письмом?
Да — этот набор обучен на обоих, а также с аннотациями на пиньинь. Вертикальные линии возвращаются как отдельные строки в порядке чтения. Почерк сложнее, чем печать для любой OCR модели, так что проверьте оценки уверенности в каждой строке.
Загружается ли мой файл?
Нет. Модели и вся обработка работают внутри вашего браузера на вашем устройстве. Вы можете проверить это сами: откройте DevToolsбраузера, посмотрите вкладку «Сеть» и обработайте файл: загрузок нет. После первого визита большинство инструментов работают полностью офлайн.
Какие языки поддерживаются?
106 языков по латинскому, кириллице, арабскому, деванагари, CJK, греческому, тайскому, тамильскому и телугу. Бенгальский — единственный серьёзный пробел, так как для него пока не существует модели v5, и пикер говорит об этом, а не догадывается.
Насколько это точно?
В чистом тексте документа уровень ошибки символов составляет менее 2%, и каждая строка содержит рейтинг доверия, чтобы вы могли видеть, какие именно стоит проверить. Почерк и фотографии низкого разрешения будут читаться хуже.
Он читает отсканированные PDF-файлы?
Да. Цифровые PDF читаются с собственного текстового слоя, где точные символы находятся в точных позициях. Отсканированные страницы проходят через обнаружение и распознавание, а смешанные документы используют оба метода.

Похожие инструменты