点击上传,或把 PDF 拖到这里
一个 PDF —— 在你的浏览器里读取,不会上传关于从 PDF 里提取文字
由文档生成的 PDF,本身就装着它的文字。字母就在文件里,阅读器只是把它们画到页面上正确的位置而已。
把它们取出来本该很简单,实际上往往不是。在阅读器里全选,页眉、页脚和页码会夹在句子中间一起过来。复制一个表格,会变成长长的一行。复制两栏,左右会交错在一起。在手机上,常常连选都选不了。
这个工具直接向 PDF 要它的文字,然后把结果放进一个可以编辑、复制,或者下载成 .txt 的文本框里。
它是在读取,不是在猜
这不是 OCR。OCR 是看着一张页面图片,试图把形状认成字母 —— 有用,但会出错,1、l、I 的混淆更是长年的老问题。
这里没有什么需要「认」。字符本来就存在 PDF 里,进去是什么样,出来就是什么样。没有认错的字母,没有置信度,也不用等:200 页的报告几秒钟就好。
它唯一做不到的,是读扫描件。扫描的页面是一张照片,里面根本没有文字。遇到这种情况,工具会明明白白告诉你,而不是丢给你一个空框 —— 并指出走 OCR 的路子。
选择页码
页码留空就是整份文档;只要一部分就写清楚:
- 5 —— 只要第 5 页
- 1-3 —— 前三页
- 1-3, 5, 8-10 —— 区间和单页混着写
当你需要的只是长报告里的某一章,或者前两页是不想要的封面和目录时,这很有用。
换行:保留还是合并
PDF 记录的是「每一行画在哪里」,不是「句子在哪里结束」。所以一个段落会以五个独立的行到达 —— 它们被断开,只是因为纸的宽度用完了。
- 保持原来的换行 —— 完全按页面排版的样子。表格、地址、诗歌、代码、清单,以及任何「行本身就是意义」的内容,都该选这个。
- 把换行合并成段落 —— 把被断开的句子重新接成一行。要粘进文档、邮件或翻译工具的正文,该选这个。
合并的判断很谨慎:句子已经结束的行、标题、项目符号、编号条目,都会保住自己的换行。只有明显在句子中间断掉的行,才会接到下一行。
页面标记
标出每页的起始位置会在页与页之间插入一行 --- 第 7 页 ---。需要回头对照原文时(引用报告、核对合同、注明出处),就让它开着。想要干净的连续正文去粘贴到别处时,把它关掉。
没有任何东西离开你的设备
打开和读取 PDF 的整个过程都在你的浏览器里完成。不上传、不排队、不保存。对真正需要这个功能的那些文件来说,这一点很重要:合同、对账单、诊断书、法律文书,以及任何签了保密协议的东西。
这也意味着没有上传带来的大小限制,而且页面加载之后,断网也能用。
大家都用它来做什么
- 从报告里取一段引文,不用重新打字
- 把文档喂给翻译工具、摘要工具或搜索
- 把手册或规章变成纯文本,好用 Ctrl+F 查找
- 从书或论文里抽出正文,用来编辑或学习
- 从阅读器复制过来总是乱的时候,把文字弄进文字处理软件
- 从 PDF 宣传册里提取网站要用的文案
- 让读屏软件也能读得动这份文档
值得一提
- 有密码保护的 PDF 要先解除 —— 请用 PDF 解除密码
- 分栏、表格和脚注按 PDF 存储的顺序出来,通常但不总是等于阅读顺序,请核对结果
- 文本框可以编辑,下载前可以先整理一下
- 下载的是 UTF-8 的纯 .txt 文件,所以中文和其他非拉丁字符都能正常保留
- 粗体、字号、颜色、图片等格式不会保留 —— 纯文本本来就是目的。要带格式的文档请用 PDF 转 Word
使用方法
- 点击点击上传,或把 PDF 拖到方框里
- 要整份文档就把页码留空,只要部分就填上想要的页
- 表格和清单选保持原来的换行,正文选把换行合并成段落
- 勾上或取消标出每页的起始位置
- 点提取文字,看一遍结果,然后复制或下载 .txt