OCR PDF

スキャンした PDF の文字を読み取り、コピーまたは .txt ファイルで保存。

100%プライベート — すべてブラウザ内で動作します。データはお使いの端末で処理され、インターネットに送信されることはありません。

クリックしてアップロード、またはスキャンした PDF をドロップ

PDF を 1 つ。端末内で OCR が読み取り、アップロードはされません

PDF の OCR について

PDF の中には、文字がまったく入っていないものがあります。スキャンした契約書、写真に撮ったレシート、FAX、図書館のスキャナーで取り込んだ古い本。どのページも、ただの文字の写った画像です。読むことはできても、選択も、コピーも、検索もできません。

それを解決するのが OCR(光学文字認識)です。各ページの画像を見て文字の形を認識し、コピー・編集・検索できる本物の文字にして返します。

このツールはページごとに処理し、1 ページ終わるたびに文字を表示します。文書全体が終わるのを待たずに作業を始められます。

すべて端末の中で行われます

スキャンした PDF は、個人的なものであることがよくあります。身分証、銀行からの手紙、医療の書類、署名済みの契約書。オンラインの OCR サービスの多くは、それをアップロードさせます。

このツールは違います。 OCR エンジン(Tesseract。多くのプロ向けソフトにも使われているオープンソースのエンジン)がブラウザの中で動きます。

  • プライベート — PDF が端末から出ることはありません
  • 登録不要、ページ数の制限なし、透かしなし

初回はエンジンと言語データ(数 MB)をダウンロードします。ブラウザが保存しておくので、次からはもっと早く始まります。

文字のページとスキャンのページが 1 つのファイルに

混ざっている PDF はよくあります。入力された文書の最後に、スキャンした署名ページが 1 枚。誰かがすでに OCR をかけたスキャン。途中に写真のページが何枚か入ったレポート。

初期設定では、ツールがまず各ページを確認します。

  • すでに本物の文字があるページは、そのままコピー — 正確で一瞬、OCR の誤りもありません
  • 画像だけのページは、OCR で読み取ります

最後に、それぞれ何ページだったかが表示されます。すべてのページに OCR をかけたいときは、「本物の文字が入っているページは」のチェックを外してください。もとの文字データが間違っていたり、文字化けしていたりするときに便利です。

きれいに読み取るコツ

OCR はとても優秀ですが、画像を読んでいるので、画像の質が大切です。

  • 正しい言語を選びましょう。 エンジンがどの文字を想定するかが変わります。日本語の文書を英語として読むと、かなや漢字がほとんど読めません。
  • まっすぐで、くっきりしたページほどよく読めます。斜めに撮ったスマホ写真やぼやけた FAX は、誤りが増えます。
  • 普通の印刷文字はよく読めます。手書き、とても小さな文字、飾り文字は苦手です。
  • 表は表ではなく、文字の行として出てきます。表の場合は、あとで列を確認してください。
  • 使う前に、必ず結果を読みましょう。 1 / l / I、0 / O、rn / m のような、OCR によくある取り違えに注意してください。

こんなときに使われています

  • スキャンした契約書や手紙から、段落をコピーする
  • スキャンしか残っていない古い本や記事の文字を手に入れる
  • レシートや請求書のスキャンを、メモの中で検索できるようにする
  • スキャンした論文や配布資料から引用を取り出す
  • 書類や記録を、手で打ち直さずにテキストにする
  • FAX で届いた文書を、編集できる形にする

知っておくとよいこと

  • パスワード保護された PDF は先に解除が必要です — PDFのパスワードを解除 を使ってください
  • 大きな文書は時間がかかります。パソコンで1 ページあたり 2〜10 秒ほど、スマホではもっとかかります。ページで必要な部分だけを読み取りましょう
  • 停止しても、読み取り済みのページはすべて残ります
  • 結果はプレーンテキストです。Word に入れるには貼り付けてください。もともと文字が入っている PDF なら PDFをWordに変換 も使えます
  • すべてのページに本物の文字がある PDF なら、PDF をテキストに のほうが速く、レイアウトの設定も豊富です

よくある質問

無料ですか?

はい。登録不要、ページ数の制限なし、透かしもありません。

PDF はアップロードされますか?

いいえ。ページの描画も読み取りも、このページの中、あなたの端末で行われます。

どの言語を読み取れますか?

英語、スペイン語、フランス語、ドイツ語、イタリア語、ポルトガル語、オランダ語、中国語(簡体字)、日本語、韓国語です。始める前に 1 つ選んでください。

なぜ文字に誤りがあるのですか?

OCR は文字の形から 1 文字ずつ推測しています。ぼやけた、斜めの、または解像度の低いスキャンだと、推測を間違えやすくなります。結果を確認し、コピーする前にボックスの中で少しの誤りを直してください。

PDF を検索できるようにできますか?

今はまだできません。文字は別の .txt ファイルとして受け取れます。もとの PDF は変更されません。

使い方

  • クリックしてアップロード をクリックするか、スキャンした PDF をボックスにドラッグします
  • 文字の言語を選びます
  • 一部のページだけ必要ならページ範囲を入力します。すべてなら空欄のままで大丈夫です
  • 文字を読み取る をクリックし、ページが次々に読み取られるのを待ちます
  • 文字を確認し、コピー または .txt をダウンロード をクリックします

関連ツール

新しいツールを定期的に追加しています。公開時にお知らせを受け取るにはYouTube でチャンネル登録してください。

他のツール

すべて表示

おすすめアプリ

すべて表示