关于这个工具
这个免费的 PDF 转 Excel 工具能找出 PDF 中的表格,并把它们变成真正的电子表格 —— 一个 .xlsx 工作簿或一个 .csv 文件 —— 行和列都已经帮你划分好。下载之前,识别出来的表格会先显示在屏幕上,你能清楚看到自己将得到什么。
一切都在你的浏览器中运行。你的 PDF 绝不会上传到服务器。
功能
- 根据页面排布自动识别行和列
- 下载前可预览表格
- .xlsx 或 .csv,看你接下来要做什么
- 每页一个工作表,或者全部放在一个表里
- 页码范围 —— 表格在第 2–5 页,就只转换那几页
- 针对棘手排版的列识别灵敏度调节
为什么 PDF 表格这么难处理(以及灵敏度设置的作用)
了解 PDF 里究竟装了什么会很有帮助,因为它同时解释了成功和失败的原因。PDF 并不存储表格。它存的是"在页面的这个位置画出字符 1 2 3"这样的指令。你看到的那个整齐的网格,只是精心对齐制造出来的错觉——里面没有单元格,没有行,很多时候连线条都没有。
所以这个工具是靠几何位置把表格重建出来的。处在同一高度的文字片段被归为一行;然后它沿着页面纵向查找反复出现的 x 坐标——也就是许多行开始写值的那些左边缘——并把它们当作列的分界。真正的表格会产生清晰且不断重复的边界,而一段普通的文章不会。
列识别调整的正是这个:多大的横向空隙才算作一个新列。
- 精细:遇到很小的空隙就切分。当本该分在不同列的值被挤成一列时,用这个
- 常规:适合大多数文档
- 粗略:忽略小空隙。当一列被拆成了两列时用它——列里含有词距较宽的文字时经常出现
如果第一次的结果看着不对,只调这一个设置解决问题的概率,远高于其他任何办法。它会即时重新运行,三档都试试看。
常见用途
- 把银行或信用卡对账单导入电子表格
- 把发票或采购单变成可以求和的行数据
- 从报告或学术论文中提取数据表
- 把供应商 PDF 里的价目表搬出来
- 在原始表格文件早已丢失时,把表格抢救回来
使用方法
- 上传 PDF —— 点击上传区域,或把文件拖进来
- 查看预览 —— 每一页识别出的表格会显示在下方
- 如果列被拆开或粘在一起,就调整"列识别",然后再看一次预览
- 只需要文档的一部分时,缩小页码范围
- 下载为 .xlsx 或 .csv
需要了解
- 不会上传任何内容。 PDF 在你的设备上读取,表格文件也在本地生成
- 扫描版 PDF 在这里行不通。 如果页面是一张文档照片,就没有文字可读——工具会明确告诉你。请先用图片转文字处理
- 合并单元格和多行单元格是自动识别最吃力的地方:内容换到两行的单元格会变成两行,因为在页面上它本来就是两行
- 务必核对合计。 重建出来的表格,在你依赖其中数字之前,都应该和 PDF 原件对照检查一遍
- 如果 PDF 给数字加了货币符号或空格,数字会以文本形式导入;用 Excel 的"分列"功能,或者整体乘以 1,就能转成数值
- CSV 只能装一个表格,因此各页会前后堆叠,中间用空行分隔。想让每页各占一个工作表,请用 .xlsx
- csv 会带 BOM 写出,这样 Windows 版 Excel 才能正确打开带重音的字符
相关工具
- Excel 转 PDF —— 反方向转换
- PDF 转图片 —— 当你想要的是页面图片时
- 图片转文字 —— 先用 OCR 识别扫描版表格
- Excel 转 CSV —— 在表格格式之间转换
- 删除重复行 —— 表格提取出来后清理一下