从照片、扫描件或截图中读西班牙语,带重音元音、ñ 和倒置——像普通字符一样处理,而不是省略。一个8 MB的模型涵盖47种拉丁字母语言——法语、德语、葡萄牙语、意大利语、荷兰语、波兰语、土耳其语、越南语等——因此在这些语言间切换的文档仍然是一次过。
使用方法
- 发布一张图片或 PDF。短信检测立即启动。
- 选择你的语言包(下载一次,8–17 MB),然后点击阅读文本。
- 复制台词,或者下载.txt/.json。PDF内容从头到尾阅读。
常见问题
- 这是和法国或德国 OCR的同一种型号吗?
- 是的。PaddleOCR 为每个脚本训练一个识别器,而非每种语言,所有 47 种拉丁字母语言共享这包 8 MB 的资料包。这就是为什么只有一个页面,而不是47个几乎相同的页面——你已经在正确的页面上。
- 我的文件会上传吗?
- 不。模型和所有处理都运行在你自己的设备上的浏览器中。你可以自己验证:打开浏览器 DevTools,关注网络标签,处理文件:没有上传。第一次访问后,大多数工具也能完全离线使用。
- 支持哪些语言?
- 涵盖拉丁字母、西里尔字母、阿拉伯字母、天城文、 CJK文、希腊文、泰语、泰米尔文和泰卢固语的106种语言。孟加拉语是唯一的主要空白,因为目前还没有针对孟加拉语的V5模型,选人是直接说的,而不是猜测。
- 它有多准确?
- 在干净的文档文本中,测量的字符错误率低于2%,每行都有置信度分数,方便你查看哪些行。手写和低分辨率照片会更难看。
- 它能读取扫描的PDF吗?
- 是的。数字PDF是从自己的文本层读取的,字符精确且位置精确。扫描页面会经过检测和识别,混合文档则同时使用两者。