Читайте тамильский шрифт по изображению. Тамильский язык пишет гласные как знаки, прикреплённые вокруг согласного — до, после, сверху или с обеих сторон одновременно — поэтому распознаватель должен читать кластер как одну единицу, а не слева направо. Английский на той же странице читается тем же пакетом на 7,9 МБ, который загружается один раз и работает офлайн.
Как это работает
- Оставьте изображение или PDF. Обнаружение текста запускается мгновенно.
- Выберите свой языковой пакет (скачано один раз, 8–17 МБ) и нажмите «Читать текст».
- Скопируйте строки или скачайте .txt / .json. PDF-файлы читаются от корки до корки.
Частые вопросы
- Какие тамильские источники она читает лучше всего?
- Печатный текст — книги, вывески, формы, скриншоты — именно на чём она обучается и где она наиболее сильна. Рукописный тамильский не входит в это обучение. Каждая строка несёт оценку уверенности, поэтому слабые чтения видны, а не беззвучны.
- Загружается ли мой файл?
- Нет. Модели и вся обработка работают внутри вашего браузера на вашем устройстве. Вы можете проверить это сами: откройте DevToolsбраузера, посмотрите вкладку «Сеть» и обработайте файл: загрузок нет. После первого визита большинство инструментов работают полностью офлайн.
- Какие языки поддерживаются?
- 106 языков по латинскому, кириллице, арабскому, деванагари, CJK, греческому, тайскому, тамильскому и телугу. Бенгальский — единственный серьёзный пробел, так как для него пока не существует модели v5, и пикер говорит об этом, а не догадывается.
- Насколько это точно?
- В чистом тексте документа уровень ошибки символов составляет менее 2%, и каждая строка содержит рейтинг доверия, чтобы вы могли видеть, какие именно стоит проверить. Почерк и фотографии низкого разрешения будут читаться хуже.
- Он читает отсканированные PDF-файлы?
- Да. Цифровые PDF читаются с собственного текстового слоя, где точные символы находятся в точных позициях. Отсканированные страницы проходят через обнаружение и распознавание, а смешанные документы используют оба метода.