关于PDF 文字识别
PDF 文字识别能把只是“一页页图片”的扫描件,比如签好的合同、老说明书、一叠票据,变成能用 Ctrl+F 搜索、能复制文字的 PDF。每一页都会经过文字识别,识别出的文字以不可见的方式放在原来字所在的位置上。你看到的页面完全不变:图片、印章、排版都和原来一样。
识别引擎支持中文和英文。有了文字层之后,“PDF 对比”和“PDF 涂黑”的按词查找也能用在这份文件上。扫描得越清晰、越端正,效果越好;页面扫歪了,可以先用“扫描件纠偏”摆正。生成的文件名后面会加上 _ocr。
PDF 文字识别怎么用
- 1上传扫描件
点“选择文件”或把扫描版 PDF 拖进来,免费账户最大 50 MB,VIP 最大 1 GB。
- 2开始识别
点“PDF 文字识别”按钮,逐页识别,页数多的扫描件需要多等一会儿。
- 3下载并搜索
下载文件名以 _ocr 结尾的 PDF,在任意阅读器里按 Ctrl+F 试试。
为什么用熊仔工匠
- 页面外观不变
扫描页原样保留,只是在上面叠了一层看不见的文字。
- 能搜索能复制
用 Ctrl+F 找词,像普通电子版 PDF 一样选中和复制。
- 中英文识别
印刷体的中文和英文都能识别,混排的行也可以。
- 配合其他工具
有了文字层,“PDF 对比”和“PDF 涂黑”的按词查找都能用。