PDF 转文字

把 PDF 里真正的文字提取出来,存成普通的 .txt —— 页码可选,排版可留。

100% 隐私安全 — 完全在您的浏览器中运行。您的数据在本地设备上处理,绝不会发送到互联网。

点击上传,或把 PDF 拖到这里

一个 PDF —— 在你的浏览器里读取,不会上传

关于从 PDF 里提取文字

由文档生成的 PDF,本身就装着它的文字。字母就在文件里,阅读器只是把它们画到页面上正确的位置而已。

把它们取出来本该很简单,实际上往往不是。在阅读器里全选,页眉、页脚和页码会夹在句子中间一起过来。复制一个表格,会变成长长的一行。复制两栏,左右会交错在一起。在手机上,常常连选都选不了。

这个工具直接向 PDF 要它的文字,然后把结果放进一个可以编辑、复制,或者下载成 .txt 的文本框里。

它是在读取,不是在猜

这不是 OCR。OCR 是看着一张页面图片,试图把形状认成字母 —— 有用,但会出错,1、l、I 的混淆更是长年的老问题。

这里没有什么需要「认」。字符本来就存在 PDF 里,进去是什么样,出来就是什么样。没有认错的字母,没有置信度,也不用等:200 页的报告几秒钟就好。

它唯一做不到的,是读扫描件。扫描的页面是一张照片,里面根本没有文字。遇到这种情况,工具会明明白白告诉你,而不是丢给你一个空框 —— 并指出走 OCR 的路子。

选择页码

页码留空就是整份文档;只要一部分就写清楚:

  • 5 —— 只要第 5 页
  • 1-3 —— 前三页
  • 1-3, 5, 8-10 —— 区间和单页混着写

当你需要的只是长报告里的某一章,或者前两页是不想要的封面和目录时,这很有用。

换行:保留还是合并

PDF 记录的是「每一行画在哪里」,不是「句子在哪里结束」。所以一个段落会以五个独立的行到达 —— 它们被断开,只是因为纸的宽度用完了。

  • 保持原来的换行 —— 完全按页面排版的样子。表格、地址、诗歌、代码、清单,以及任何「行本身就是意义」的内容,都该选这个。
  • 把换行合并成段落 —— 把被断开的句子重新接成一行。要粘进文档、邮件或翻译工具的正文,该选这个。

合并的判断很谨慎:句子已经结束的行、标题、项目符号、编号条目,都会保住自己的换行。只有明显在句子中间断掉的行,才会接到下一行。

页面标记

标出每页的起始位置会在页与页之间插入一行 --- 第 7 页 ---。需要回头对照原文时(引用报告、核对合同、注明出处),就让它开着。想要干净的连续正文去粘贴到别处时,把它关掉。

没有任何东西离开你的设备

打开和读取 PDF 的整个过程都在你的浏览器里完成。不上传、不排队、不保存。对真正需要这个功能的那些文件来说,这一点很重要:合同、对账单、诊断书、法律文书,以及任何签了保密协议的东西。

这也意味着没有上传带来的大小限制,而且页面加载之后,断网也能用。

大家都用它来做什么

  • 报告里取一段引文,不用重新打字
  • 把文档喂给翻译工具、摘要工具或搜索
  • 手册或规章变成纯文本,好用 Ctrl+F 查找
  • 书或论文里抽出正文,用来编辑或学习
  • 从阅读器复制过来总是乱的时候,把文字弄进文字处理软件
  • 从 PDF 宣传册里提取网站要用的文案
  • 读屏软件也能读得动这份文档

值得一提

  • 有密码保护的 PDF 要先解除 —— 请用 PDF 解除密码
  • 扫描件 PDF 里没有文字;先用 PDF 转 JPG,再用图片转文字
  • 分栏、表格和脚注按 PDF 存储的顺序出来,通常但不总是等于阅读顺序,请核对结果
  • 文本框可以编辑,下载前可以先整理一下
  • 下载的是 UTF-8 的纯 .txt 文件,所以中文和其他非拉丁字符都能正常保留
  • 粗体、字号、颜色、图片等格式不会保留 —— 纯文本本来就是目的。要带格式的文档请用 PDF 转 Word

使用方法

  • 点击点击上传,或把 PDF 拖到方框里
  • 要整份文档就把页码留空,只要部分就填上想要的页
  • 表格和清单选保持原来的换行,正文选把换行合并成段落
  • 勾上或取消标出每页的起始位置
  • 提取文字,看一遍结果,然后复制下载 .txt

相关工具

我们会定期添加新工具——在 YouTube 上订阅,即可在每个新工具上线时收到通知。

更多工具

查看全部

推荐应用

查看全部