关于PDF 转文字
PDF 转文字适合只要文字、不要版式的时候:引用报告里的一段话、把文件内容交给翻译工具、检索旧资料、把条款粘进邮件。转完后文字直接显示在页面上,旁边有“复制”按钮,同时保存成 UTF-8 编码的 TXT 文件。每一行会按阅读顺序排好,并拼回完整段落,句子不会在 PDF 的每个行尾断开;页眉放在最前、页脚放在最后,双栏排版先读左栏再读右栏。
文字识别(OCR)按页判断。默认的“自动判断”只识别扫描页和字体乱码的页面,其余页面直接用 PDF 自带的文字,所以打字的合同后面附着扫描的签字页,每一页的文字都能拿到。“始终识别”每页都用 OCR,“关闭”则一页都不识别。OCR 能识别印刷体的中文和英文。“文字排列”选“按段落(自动接上断行)”得到连贯的段落,选“按行(和页面上一样)”则地址、诗歌、清单都保持原来的分行。“页码”可以只转其中一部分,打开“保留分页”后每页开头会加上“— 3 —”这样的标记。免费账户每个文件用 OCR 识别的扫描页有数量上限,超出的页数结果里会写明,VIP 每页都识别。
PDF 转文字怎么用
- 1上传 PDF
选择或拖入文件。免费账户可处理 50 MB 以内的 PDF,VIP 可到 1 GB。
- 2选 OCR 和排列方式
“文字识别(OCR)”保持“自动判断”,在“文字排列”里选按段落或按行,需要时再设“页码”或打开“保留分页”。
- 3开始提取
点“PDF 转文字”按钮,服务器提取文字、识别扫描页,结果显示在页面上的文本框里。
- 4复制或下载
点“复制”粘贴到别处,或者下载 TXT 文件。
为什么用熊仔工匠
- 段落完整
去掉句子中间的换行,粘进 Word 或邮件里不用再一行行整理;地址、清单也可以按行保留。
- 阅读顺序正确
双栏排版按人读的顺序来,先左栏、后右栏,页眉在前、页脚在后。
- 只在需要时 OCR
扫描页和字体乱码的页面用 OCR 识别,本来有文字的页面原样保留。
- UTF-8 编码
TXT 用 UTF-8 保存,中文、带音标的字母和符号在任何系统里都不乱码。