点击上传,或把扫描版 PDF 拖到这里
一个 PDF —— 在你的设备上用 OCR 识别,不会上传关于 PDF 的 OCR 识别
有些 PDF 里根本没有文字。扫描的合同、拍照的收据、传真、图书馆扫描仪扫出来的旧书 —— 每一页都只是一张文字的图片。你能看懂,却无法选中、复制或搜索。
OCR(光学字符识别)能解决这个问题。它查看每一页的图片,识别出字母和汉字的形状,再还给你可以复制、编辑和搜索的真实文字。
本工具逐页处理,每识别完一页就显示该页的文字,不用等整个文档处理完才开始用。
一切都在你的设备上完成
扫描版 PDF 往往是比较私密的文件:身份证件、银行来信、医疗表格、已签字的合同。大多数在线 OCR 服务都要求你先上传。
这个工具不用。 OCR 引擎(Tesseract,许多专业软件背后的开源引擎)直接在你的浏览器里运行:
- 保护隐私 —— PDF 从不离开你的设备
- 无需注册,不限页数,没有水印
首次运行时会下载引擎和语言数据,大约几 MB。浏览器会把它们保存下来,下次启动会更快。
文字页和扫描页在同一个文件里
很多 PDF 是混合的。打字排版的页面,最后附一张扫描的签名页。别人已经做过 OCR 的扫描件。中间夹着几张拍照页面的报告。
默认情况下,工具会先检查每一页:
- 已经有真实文字的页面,直接复制原文 —— 准确、即时,没有 OCR 错误
- 只是一张图片的页面,用 OCR 识别
最后会显示各有多少页走了哪种方式。取消勾选“已经有真实文字的页面”,就能强制每一页都用 OCR —— 适合原有文字层有错或乱码的情况。
如何获得最佳效果
OCR 很强大,但它读的是图片,所以图片质量很重要:
- 选对语言。 语言决定了引擎预期会出现哪些字符。中文文档如果按英文识别,汉字基本都认不出来。
- 端正、清晰的页面识别效果最好。手机拍歪的照片或模糊的传真,错误会更多。
- 普通印刷文字识别得很好。手写字、很小的字和花体字识别效果差。
- 表格会变成一行行文字,而不是表格。如果是表格,事后请检查各列。
- 使用前一定要看一遍结果。注意 1 / l / I、0 / O 和 rn / m —— 这些是 OCR 最常见的混淆。
大家都用它来做什么
- 从扫描的合同或信件里复制一段文字
- 获取只有扫描件的旧书或旧文章的文字
- 让扫描的收据或发票在笔记里可以搜索
- 从扫描的论文和讲义中摘取引文
- 录入表格和档案,不用手动重新打字
- 把传真文件变成可以编辑的文字
值得一提
- 有密码保护的 PDF 需要先解锁 —— 请用解锁 PDF
- 大文档需要时间:在电脑上大约每页 2–10 秒,在手机上更久。用页码只识别你需要的部分
- 点停止后,已经识别的页面都会保留
- 结果是纯文本。要放进 Word,直接粘贴即可;如果 PDF 本来就有文字,也可以用 PDF 转 Word
- 如果你的 PDF 每一页都有真实文字,PDF 转文字 更快,排版选项也更多
常见问题
免费吗?
免费。无需注册,不限页数,没有水印。
我的 PDF 会被上传吗?
不会。页面在这个网页里绘制和识别,全程都在你自己的设备上。
能识别哪些语言?
英语、西班牙语、法语、德语、意大利语、葡萄牙语、荷兰语、简体中文、日语和韩语。开始前请先选择一种。
为什么文字里有错误?
OCR 是根据形状来猜每个字符的。扫描件模糊、歪斜或分辨率低,猜错的次数就会变多。请检查结果,在复制之前先在文本框里改正少数错误。
能把我的 PDF 变成可搜索的吗?
暂时还不能 —— 它会把文字单独给你一个 .txt 文件。你的原始 PDF 不会被修改。
使用方法
- 点击点击上传,或把扫描版 PDF 拖到框里
- 选择文字的语言
- 如果只需要部分页面,输入页码范围;留空则识别全部页面
- 点击识别文字,看着页面一页页识别出来
- 检查文字,然后点击复制或下载 .txt