關於PDF 轉 Markdown
PDF 轉 Markdown 適合把 PDF 內容放進知識庫、文件網站、Git 倉庫、Notion 或 Obsidian,或者整理成乾淨的文字交給 AI 對話。上傳檔案,得到的 Markdown 裡標題用 # 標記,列表用 - 和數字,表格是標準的豎線表格,中間是普通段落。開啟“同時匯出圖片”,會得到一個壓縮包:Markdown 檔案加 images 資料夾,每張圖片在文中原來的位置用連結引用,放進 Obsidian、Notion 或靜態網站就能顯示。
標題根據字號識別,文件結構能保留下來。頁首、頁尾和頁碼會去掉,被行尾截斷的段落會拼回完整的一段。掃描頁也能轉:“文字識別(OCR)”選“自動判斷”時只識別掃描頁和字型亂碼的頁面,“始終識別”每頁都識別,“關閉”則不識別。OCR 能識別印刷體的中文和英文。“頁碼”可以只轉其中一章或一段。結果顯示在頁面上,帶“複製”按鈕,同時儲存為 UTF-8 編碼的 .md 檔案。免費帳戶每個檔案用 OCR 識別的掃描頁有數量上限,VIP 每頁都識別。
PDF 轉 Markdown怎麼用
- 1上傳 PDF
選擇或拖入檔案。免費帳戶可轉 50 MB 以內的 PDF,VIP 可到 1 GB。
- 2設定並轉換
“自動判斷”會自己識別掃描頁;要圖片就勾選“同時匯出圖片”,只轉一部分就填“頁碼”,再點“PDF 轉 Markdown”。
- 3複製結果
點“複製”直接粘進編輯器,或者下載 .md 檔案,帶圖片時下載壓縮包。
為什麼用熊仔工匠
- 語法標準
標題、無序列表、有序列表、表格都用標準語法,GitHub 和大多數編輯器都能正確顯示,頁碼、頁首、頁尾都會去掉。
- 圖片原位連結
開啟“同時匯出圖片”,圖片存進 images 資料夾,在文中原來的位置連結好。
- 掃描頁逐頁識別
只有掃描頁和字型亂碼的頁面用 OCR,本來有文字的頁面保留原文。