OCR PDF

读出扫描版 PDF 里的文字 —— 直接复制,或保存为 .txt 文件。

100% 隐私安全 — 完全在您的浏览器中运行。您的数据在本地设备上处理,绝不会发送到互联网。

点击上传,或把扫描版 PDF 拖到这里

一个 PDF —— 在你的设备上用 OCR 识别,不会上传

关于 PDF 的 OCR 识别

有些 PDF 里根本没有文字。扫描的合同、拍照的收据、传真、图书馆扫描仪扫出来的旧书 —— 每一页都只是一张文字的图片。你能看懂,却无法选中、复制或搜索。

OCR(光学字符识别)能解决这个问题。它查看每一页的图片,识别出字母和汉字的形状,再还给你可以复制、编辑和搜索的真实文字。

本工具逐页处理,每识别完一页就显示该页的文字,不用等整个文档处理完才开始用。

一切都在你的设备上完成

扫描版 PDF 往往是比较私密的文件:身份证件、银行来信、医疗表格、已签字的合同。大多数在线 OCR 服务都要求你先上传。

这个工具不用。 OCR 引擎(Tesseract,许多专业软件背后的开源引擎)直接在你的浏览器里运行:

  • 保护隐私 —— PDF 从不离开你的设备
  • 无需注册,不限页数,没有水印

首次运行时会下载引擎和语言数据,大约几 MB。浏览器会把它们保存下来,下次启动会更快。

文字页和扫描页在同一个文件里

很多 PDF 是混合的。打字排版的页面,最后附一张扫描的签名页。别人已经做过 OCR 的扫描件。中间夹着几张拍照页面的报告。

默认情况下,工具会先检查每一页:

  • 已经有真实文字的页面,直接复制原文 —— 准确、即时,没有 OCR 错误
  • 只是一张图片的页面,用 OCR 识别

最后会显示各有多少页走了哪种方式。取消勾选“已经有真实文字的页面”,就能强制每一页都用 OCR —— 适合原有文字层有错或乱码的情况。

如何获得最佳效果

OCR 很强大,但它读的是图片,所以图片质量很重要:

  • 选对语言。 语言决定了引擎预期会出现哪些字符。中文文档如果按英文识别,汉字基本都认不出来。
  • 端正、清晰的页面识别效果最好。手机拍歪的照片或模糊的传真,错误会更多。
  • 普通印刷文字识别得很好。手写字、很小的字和花体字识别效果差。
  • 表格会变成一行行文字,而不是表格。如果是表格,事后请检查各列。
  • 使用前一定要看一遍结果。注意 1 / l / I、0 / O 和 rn / m —— 这些是 OCR 最常见的混淆。

大家都用它来做什么

  • 从扫描的合同或信件里复制一段文字
  • 获取只有扫描件的旧书或旧文章的文字
  • 让扫描的收据或发票在笔记里可以搜索
  • 从扫描的论文和讲义中摘取引文
  • 录入表格和档案,不用手动重新打字
  • 把传真文件变成可以编辑的文字

值得一提

  • 有密码保护的 PDF 需要先解锁 —— 请用解锁 PDF
  • 大文档需要时间:在电脑上大约每页 2–10 秒,在手机上更久。用页码只识别你需要的部分
  • 点停止后,已经识别的页面都会保留
  • 结果是纯文本。要放进 Word,直接粘贴即可;如果 PDF 本来就有文字,也可以用 PDF 转 Word
  • 如果你的 PDF 每一页都有真实文字,PDF 转文字 更快,排版选项也更多

常见问题

免费吗?

免费。无需注册,不限页数,没有水印。

我的 PDF 会被上传吗?

不会。页面在这个网页里绘制和识别,全程都在你自己的设备上。

能识别哪些语言?

英语、西班牙语、法语、德语、意大利语、葡萄牙语、荷兰语、简体中文、日语和韩语。开始前请先选择一种。

为什么文字里有错误?

OCR 是根据形状来猜每个字符的。扫描件模糊、歪斜或分辨率低,猜错的次数就会变多。请检查结果,在复制之前先在文本框里改正少数错误。

能把我的 PDF 变成可搜索的吗?

暂时还不能 —— 它会把文字单独给你一个 .txt 文件。你的原始 PDF 不会被修改。

使用方法

  • 点击点击上传,或把扫描版 PDF 拖到框里
  • 选择文字的语言
  • 如果只需要部分页面,输入页码范围;留空则识别全部页面
  • 点击识别文字,看着页面一页页识别出来
  • 检查文字,然后点击复制或下载 .txt

相关工具

我们会定期添加新工具——在 YouTube 上订阅,即可在每个新工具上线时收到通知。

更多工具

查看全部

推荐应用

查看全部