クリックしてアップロード、またはスキャンした PDF をドロップ
PDF を 1 つ。端末内で OCR が読み取り、アップロードはされませんPDF の OCR について
PDF の中には、文字がまったく入っていないものがあります。スキャンした契約書、写真に撮ったレシート、FAX、図書館のスキャナーで取り込んだ古い本。どのページも、ただの文字の写った画像です。読むことはできても、選択も、コピーも、検索もできません。
それを解決するのが OCR(光学文字認識)です。各ページの画像を見て文字の形を認識し、コピー・編集・検索できる本物の文字にして返します。
このツールはページごとに処理し、1 ページ終わるたびに文字を表示します。文書全体が終わるのを待たずに作業を始められます。
すべて端末の中で行われます
スキャンした PDF は、個人的なものであることがよくあります。身分証、銀行からの手紙、医療の書類、署名済みの契約書。オンラインの OCR サービスの多くは、それをアップロードさせます。
このツールは違います。 OCR エンジン(Tesseract。多くのプロ向けソフトにも使われているオープンソースのエンジン)がブラウザの中で動きます。
- プライベート — PDF が端末から出ることはありません
- 登録不要、ページ数の制限なし、透かしなし
初回はエンジンと言語データ(数 MB)をダウンロードします。ブラウザが保存しておくので、次からはもっと早く始まります。
文字のページとスキャンのページが 1 つのファイルに
混ざっている PDF はよくあります。入力された文書の最後に、スキャンした署名ページが 1 枚。誰かがすでに OCR をかけたスキャン。途中に写真のページが何枚か入ったレポート。
初期設定では、ツールがまず各ページを確認します。
- すでに本物の文字があるページは、そのままコピー — 正確で一瞬、OCR の誤りもありません
- 画像だけのページは、OCR で読み取ります
最後に、それぞれ何ページだったかが表示されます。すべてのページに OCR をかけたいときは、「本物の文字が入っているページは」のチェックを外してください。もとの文字データが間違っていたり、文字化けしていたりするときに便利です。
きれいに読み取るコツ
OCR はとても優秀ですが、画像を読んでいるので、画像の質が大切です。
- 正しい言語を選びましょう。 エンジンがどの文字を想定するかが変わります。日本語の文書を英語として読むと、かなや漢字がほとんど読めません。
- まっすぐで、くっきりしたページほどよく読めます。斜めに撮ったスマホ写真やぼやけた FAX は、誤りが増えます。
- 普通の印刷文字はよく読めます。手書き、とても小さな文字、飾り文字は苦手です。
- 表は表ではなく、文字の行として出てきます。表の場合は、あとで列を確認してください。
- 使う前に、必ず結果を読みましょう。 1 / l / I、0 / O、rn / m のような、OCR によくある取り違えに注意してください。
こんなときに使われています
- スキャンした契約書や手紙から、段落をコピーする
- スキャンしか残っていない古い本や記事の文字を手に入れる
- レシートや請求書のスキャンを、メモの中で検索できるようにする
- スキャンした論文や配布資料から引用を取り出す
- 書類や記録を、手で打ち直さずにテキストにする
- FAX で届いた文書を、編集できる形にする
知っておくとよいこと
- パスワード保護された PDF は先に解除が必要です — PDFのパスワードを解除 を使ってください
- 大きな文書は時間がかかります。パソコンで1 ページあたり 2〜10 秒ほど、スマホではもっとかかります。ページで必要な部分だけを読み取りましょう
- 停止しても、読み取り済みのページはすべて残ります
- 結果はプレーンテキストです。Word に入れるには貼り付けてください。もともと文字が入っている PDF なら PDFをWordに変換 も使えます
- すべてのページに本物の文字がある PDF なら、PDF をテキストに のほうが速く、レイアウトの設定も豊富です
よくある質問
無料ですか?
はい。登録不要、ページ数の制限なし、透かしもありません。
PDF はアップロードされますか?
いいえ。ページの描画も読み取りも、このページの中、あなたの端末で行われます。
どの言語を読み取れますか?
英語、スペイン語、フランス語、ドイツ語、イタリア語、ポルトガル語、オランダ語、中国語(簡体字)、日本語、韓国語です。始める前に 1 つ選んでください。
なぜ文字に誤りがあるのですか?
OCR は文字の形から 1 文字ずつ推測しています。ぼやけた、斜めの、または解像度の低いスキャンだと、推測を間違えやすくなります。結果を確認し、コピーする前にボックスの中で少しの誤りを直してください。
PDF を検索できるようにできますか?
今はまだできません。文字は別の .txt ファイルとして受け取れます。もとの PDF は変更されません。
使い方
- クリックしてアップロード をクリックするか、スキャンした PDF をボックスにドラッグします
- 文字の言語を選びます
- 一部のページだけ必要ならページ範囲を入力します。すべてなら空欄のままで大丈夫です
- 文字を読み取る をクリックし、ページが次々に読み取られるのを待ちます
- 文字を確認し、コピー または .txt をダウンロード をクリックします
関連ツール
- PDF をテキストに — すでに本物の文字が入っている PDF 向け
- 画像から文字を抽出 — 写真やスクリーンショットに同じ OCR を
- PDFをWordに変換 — 文字の入った PDF を編集できる文書に
- PDF を JPG に — スキャンしたページを画像として保存
- PDF圧縮 — 重いスキャンを小さくする
- PDFのパスワードを解除 — 読み取る前にパスワードを外す