關於PDF 轉文字
PDF 轉文字適合只要文字、不要版式的時候:引用報告裡的一段話、把檔案內容交給翻譯工具、檢索舊資料、把條款粘進郵件。轉完後文字直接顯示在頁面上,旁邊有“複製”按鈕,同時儲存成 UTF-8 編碼的 TXT 檔案。每一行會按閱讀順序排好,並拼回完整段落,句子不會在 PDF 的每個行尾斷開;頁首放在最前、頁尾放在最後,雙欄排版先讀左欄再讀右欄。
文字識別(OCR)按頁判斷。預設的“自動判斷”只識別掃描頁和字型亂碼的頁面,其餘頁面直接用 PDF 自帶的文字,所以打字的合同後面附著掃描的簽字頁,每一頁的文字都能拿到。“始終識別”每頁都用 OCR,“關閉”則一頁都不識別。OCR 能識別印刷體的中文和英文。“文字排列”選“按段落(自動接上斷行)”得到連貫的段落,選“按行(和頁面上一樣)”則地址、詩歌、清單都保持原來的分行。“頁碼”可以只轉其中一部分,開啟“保留分頁”後每頁開頭會加上“— 3 —”這樣的標記。免費帳戶每個檔案用 OCR 識別的掃描頁有數量上限,超出的頁數結果裡會寫明,VIP 每頁都識別。
PDF 轉文字怎麼用
- 1上傳 PDF
選擇或拖入檔案。免費帳戶可處理 50 MB 以內的 PDF,VIP 可到 1 GB。
- 2選 OCR 和排列方式
“文字識別(OCR)”保持“自動判斷”,在“文字排列”裡選按段落或按行,需要時再設“頁碼”或開啟“保留分頁”。
- 3開始提取
點“PDF 轉文字”按鈕,伺服器提取文字、識別掃描頁,結果顯示在頁面上的文字框裡。
- 4複製或下載
點“複製”貼上到別處,或者下載 TXT 檔案。
為什麼用熊仔工匠
- 段落完整
去掉句子中間的換行,粘進 Word 或郵件裡不用再一行行整理;地址、清單也可以按行保留。
- 閱讀順序正確
雙欄排版按人讀的順序來,先左欄、後右欄,頁首在前、頁尾在後。
- 只在需要時 OCR
掃描頁和字型亂碼的頁面用 OCR 識別,本來有文字的頁面原樣保留。
- UTF-8 編碼
TXT 用 UTF-8 儲存,中文、帶音標的字母和符號在任何系統裡都不亂碼。