关于PDF 转 Markdown
PDF 转 Markdown 适合把 PDF 内容放进知识库、文档网站、Git 仓库、Notion 或 Obsidian,或者整理成干净的文字交给 AI 对话。上传文件,得到的 Markdown 里标题用 # 标记,列表用 - 和数字,表格是标准的竖线表格,中间是普通段落。打开“同时导出图片”,会得到一个压缩包:Markdown 文件加 images 文件夹,每张图片在文中原来的位置用链接引用,放进 Obsidian、Notion 或静态网站就能显示。
标题根据字号识别,文档结构能保留下来。页眉、页脚和页码会去掉,被行尾截断的段落会拼回完整的一段。扫描页也能转:“文字识别(OCR)”选“自动判断”时只识别扫描页和字体乱码的页面,“始终识别”每页都识别,“关闭”则不识别。OCR 能识别印刷体的中文和英文。“页码”可以只转其中一章或一段。结果显示在页面上,带“复制”按钮,同时保存为 UTF-8 编码的 .md 文件。免费账户每个文件用 OCR 识别的扫描页有数量上限,VIP 每页都识别。
PDF 转 Markdown怎么用
- 1上传 PDF
选择或拖入文件。免费账户可转 50 MB 以内的 PDF,VIP 可到 1 GB。
- 2设置并转换
“自动判断”会自己识别扫描页;要图片就勾选“同时导出图片”,只转一部分就填“页码”,再点“PDF 转 Markdown”。
- 3复制结果
点“复制”直接粘进编辑器,或者下载 .md 文件,带图片时下载压缩包。
为什么用熊仔工匠
- 语法标准
标题、无序列表、有序列表、表格都用标准语法,GitHub 和大多数编辑器都能正确显示,页码、页眉、页脚都会去掉。
- 图片原位链接
打开“同时导出图片”,图片存进 images 文件夹,在文中原来的位置链接好。
- 扫描页逐页识别
只有扫描页和字体乱码的页面用 OCR,本来有文字的页面保留原文。