關於PDF 文字識別
PDF 文字識別能把只是“一頁頁圖片”的掃描件,比如簽好的合同、老說明書、一疊票據,變成能用 Ctrl+F 搜尋、能複製文字的 PDF。每一頁都會經過文字識別,識別出的文字以不可見的方式放在原來字所在的位置上。你看到的頁面完全不變:圖片、印章、排版都和原來一樣。
識別引擎支援中文和英文。有了文字層之後,“PDF 對比”和“PDF 塗黑”的按詞查詢也能用在這份檔案上。掃描得越清晰、越端正,效果越好;頁面掃歪了,可以先用“掃描件糾偏”擺正。生成的檔名後面會加上 _ocr。
PDF 文字識別怎麼用
- 1上傳掃描件
點“選擇檔案”或把掃描版 PDF 拖進來,免費帳戶最大 50 MB,VIP 最大 1 GB。
- 2開始識別
點“PDF 文字識別”按鈕,逐頁識別,頁數多的掃描件需要多等一會兒。
- 3下載並搜尋
下載檔名以 _ocr 結尾的 PDF,在任意閱讀器裡按 Ctrl+F 試試。
為什麼用熊仔工匠
- 頁面外觀不變
掃描頁原樣保留,只是在上面疊了一層看不見的文字。
- 能搜尋能複製
用 Ctrl+F 找詞,像普通電子版 PDF 一樣選中和複製。
- 中英文識別
印刷體的中文和英文都能識別,混排的行也可以。
- 配合其他工具
有了文字層,“PDF 對比”和“PDF 塗黑”的按詞查詢都能用。