OCR PDF

스캔한 PDF의 글자를 읽어 복사하거나 .txt 파일로 저장하세요.

100% 비공개 — 전적으로 브라우저에서 실행됩니다. 데이터는 사용자의 기기에서 처리되며 인터넷으로 전송되지 않습니다.

클릭해서 업로드하거나 스캔한 PDF를 여기로 끌어다 놓으세요

PDF 한 개 — 기기에서 OCR로 읽으며 업로드하지 않습니다

PDF용 OCR이란

어떤 PDF에는 글자가 전혀 들어 있지 않습니다. 스캔한 계약서, 사진으로 찍은 영수증, 팩스, 도서관 스캐너로 뜬 오래된 책 — 각 페이지가 그저 글자가 찍힌 그림일 뿐입니다. 읽을 수는 있지만 선택도, 복사도, 검색도 할 수 없습니다.

OCR(광학 문자 인식)이 이 문제를 해결합니다. 각 페이지의 그림을 보고 글자의 모양을 알아본 뒤, 복사하고 편집하고 검색할 수 있는 진짜 글자로 돌려줍니다.

이 도구는 한 페이지씩 처리하고, 페이지가 끝날 때마다 글자를 보여 줍니다. 문서 전체가 끝날 때까지 기다리지 않고 바로 작업을 시작할 수 있습니다.

모든 일이 기기 안에서 일어납니다

스캔한 PDF는 개인적인 문서인 경우가 많습니다. 신분증, 은행에서 온 편지, 의료 서류, 서명한 계약서. 대부분의 온라인 OCR 서비스는 이런 파일을 업로드하라고 합니다.

이 도구는 그렇지 않습니다. OCR 엔진(Tesseract, 많은 전문 프로그램에 쓰이는 오픈 소스 엔진)이 브라우저 안에서 돌아갑니다.

  • 비공개 — PDF가 기기 밖으로 나가지 않습니다
  • 가입 없음, 페이지 제한 없음, 워터마크 없음

처음 실행할 때 엔진과 언어 데이터를 내려받습니다(몇 MB). 브라우저가 저장해 두기 때문에 다음에는 더 빨리 시작됩니다.

글자 페이지와 스캔 페이지가 한 파일에

섞여 있는 PDF가 많습니다. 타이핑한 페이지 끝에 스캔한 서명 페이지가 한 장. 누군가 이미 OCR을 돌린 스캔본. 중간에 사진으로 찍은 페이지가 몇 장 들어간 보고서.

기본적으로 이 도구는 먼저 각 페이지를 확인합니다.

  • 이미 진짜 글자가 있는 페이지는 그대로 복사 — 정확하고 즉시, OCR 오류가 없습니다
  • 그림뿐인 페이지는 OCR로 읽습니다

마지막에 각각 몇 페이지였는지 보여 줍니다. 모든 페이지에 OCR을 강제로 쓰려면 '이미 진짜 글자가 있는 페이지' 체크를 해제하세요. 기존 글자 데이터가 틀리거나 깨졌을 때 유용합니다.

가장 좋은 결과를 얻으려면

OCR은 매우 뛰어나지만 그림을 읽는 것이라 그림 상태가 중요합니다.

  • 올바른 언어를 고르세요. 엔진이 어떤 글자를 기대할지가 달라집니다. 한국어 문서를 영어로 읽으면 한글을 거의 알아보지 못합니다.
  • 반듯하고 선명한 페이지가 가장 잘 읽힙니다. 비뚤게 찍은 휴대폰 사진이나 흐릿한 팩스는 오류가 늘어납니다.
  • 일반 인쇄 글자는 잘 읽힙니다. 손글씨, 아주 작은 글자, 장식용 글꼴은 잘 읽히지 않습니다.
  • 표는 표가 아니라 글자 줄로 나옵니다. 표라면 나중에 열을 확인하세요.
  • 믿고 쓰기 전에 꼭 결과를 읽어 보세요. 1 / l / I, 0 / O, rn / m 같은 대표적인 OCR 혼동을 조심하세요.

이런 때 씁니다

  • 스캔한 계약서나 편지에서 한 단락을 복사할 때
  • 스캔본으로만 남은 오래된 책이나 기사의 글을 얻을 때
  • 스캔한 영수증이나 청구서를 메모에서 검색할 수 있게 만들 때
  • 스캔한 논문과 유인물에서 인용문을 뽑을 때
  • 서식과 기록을 손으로 다시 치지 않고 옮길 때
  • 팩스로 받은 문서를 편집할 수 있게 바꿀 때

알아두면 좋은 점

  • 암호가 걸린 PDF는 먼저 잠금을 풀어야 합니다 — PDF 잠금 해제를 이용하세요
  • 큰 문서는 시간이 걸립니다. 컴퓨터에서 페이지당 2–10초 정도, 휴대폰에서는 더 걸립니다. 페이지로 필요한 부분만 읽으세요
  • 중지해도 이미 읽은 페이지는 모두 남습니다
  • 결과는 일반 텍스트입니다. Word에 넣으려면 붙여 넣거나, 이미 글자가 있는 PDF라면 PDF를 워드로를 이용하세요
  • 모든 페이지에 진짜 글자가 있는 PDF라면 PDF를 텍스트로가 더 빠르고 레이아웃 옵션도 많습니다

자주 묻는 질문

무료인가요?

네. 가입 없음, 페이지 제한 없음, 워터마크 없음입니다.

PDF가 업로드되나요?

아니요. 페이지를 그리고 읽는 일은 모두 이 페이지 안, 사용자의 기기에서 이루어집니다.

어떤 언어를 읽을 수 있나요?

영어, 스페인어, 프랑스어, 독일어, 이탈리아어, 포르투갈어, 네덜란드어, 중국어(간체), 일본어, 한국어입니다. 시작하기 전에 하나를 고르세요.

왜 글자에 오류가 있나요?

OCR은 모양을 보고 글자를 하나씩 추측합니다. 흐릿하거나 비뚤어졌거나 해상도가 낮은 스캔은 잘못 추측하는 일이 많아집니다. 결과를 확인하고, 복사하기 전에 상자 안에서 몇 군데 오류를 고치세요.

PDF를 검색 가능하게 만들 수 있나요?

아직은 안 됩니다. 글자는 별도의 .txt 파일로 드립니다. 원본 PDF는 바뀌지 않습니다.

사용 방법

  • 클릭해서 업로드를 클릭하거나, 스캔한 PDF를 상자로 끌어다 놓습니다
  • 글자의 언어를 고릅니다
  • 일부 페이지만 필요하면 페이지 범위를 입력합니다. 전체라면 비워 두세요
  • 글자 읽기를 클릭하고 페이지가 하나씩 읽히는 것을 지켜봅니다
  • 글자를 확인한 뒤 복사 또는 .txt 내려받기를 클릭합니다

관련 도구

새로운 도구를 꾸준히 추가하고 있습니다 — 공개될 때 알림을 받으려면 YouTube에서 구독하세요.

다른 도구

전체 보기

추천 앱

전체 보기