클릭해서 업로드하거나 스캔한 PDF를 여기로 끌어다 놓으세요
PDF 한 개 — 기기에서 OCR로 읽으며 업로드하지 않습니다PDF용 OCR이란
어떤 PDF에는 글자가 전혀 들어 있지 않습니다. 스캔한 계약서, 사진으로 찍은 영수증, 팩스, 도서관 스캐너로 뜬 오래된 책 — 각 페이지가 그저 글자가 찍힌 그림일 뿐입니다. 읽을 수는 있지만 선택도, 복사도, 검색도 할 수 없습니다.
OCR(광학 문자 인식)이 이 문제를 해결합니다. 각 페이지의 그림을 보고 글자의 모양을 알아본 뒤, 복사하고 편집하고 검색할 수 있는 진짜 글자로 돌려줍니다.
이 도구는 한 페이지씩 처리하고, 페이지가 끝날 때마다 글자를 보여 줍니다. 문서 전체가 끝날 때까지 기다리지 않고 바로 작업을 시작할 수 있습니다.
모든 일이 기기 안에서 일어납니다
스캔한 PDF는 개인적인 문서인 경우가 많습니다. 신분증, 은행에서 온 편지, 의료 서류, 서명한 계약서. 대부분의 온라인 OCR 서비스는 이런 파일을 업로드하라고 합니다.
이 도구는 그렇지 않습니다. OCR 엔진(Tesseract, 많은 전문 프로그램에 쓰이는 오픈 소스 엔진)이 브라우저 안에서 돌아갑니다.
- 비공개 — PDF가 기기 밖으로 나가지 않습니다
- 가입 없음, 페이지 제한 없음, 워터마크 없음
처음 실행할 때 엔진과 언어 데이터를 내려받습니다(몇 MB). 브라우저가 저장해 두기 때문에 다음에는 더 빨리 시작됩니다.
글자 페이지와 스캔 페이지가 한 파일에
섞여 있는 PDF가 많습니다. 타이핑한 페이지 끝에 스캔한 서명 페이지가 한 장. 누군가 이미 OCR을 돌린 스캔본. 중간에 사진으로 찍은 페이지가 몇 장 들어간 보고서.
기본적으로 이 도구는 먼저 각 페이지를 확인합니다.
- 이미 진짜 글자가 있는 페이지는 그대로 복사 — 정확하고 즉시, OCR 오류가 없습니다
- 그림뿐인 페이지는 OCR로 읽습니다
마지막에 각각 몇 페이지였는지 보여 줍니다. 모든 페이지에 OCR을 강제로 쓰려면 '이미 진짜 글자가 있는 페이지' 체크를 해제하세요. 기존 글자 데이터가 틀리거나 깨졌을 때 유용합니다.
가장 좋은 결과를 얻으려면
OCR은 매우 뛰어나지만 그림을 읽는 것이라 그림 상태가 중요합니다.
- 올바른 언어를 고르세요. 엔진이 어떤 글자를 기대할지가 달라집니다. 한국어 문서를 영어로 읽으면 한글을 거의 알아보지 못합니다.
- 반듯하고 선명한 페이지가 가장 잘 읽힙니다. 비뚤게 찍은 휴대폰 사진이나 흐릿한 팩스는 오류가 늘어납니다.
- 일반 인쇄 글자는 잘 읽힙니다. 손글씨, 아주 작은 글자, 장식용 글꼴은 잘 읽히지 않습니다.
- 표는 표가 아니라 글자 줄로 나옵니다. 표라면 나중에 열을 확인하세요.
- 믿고 쓰기 전에 꼭 결과를 읽어 보세요. 1 / l / I, 0 / O, rn / m 같은 대표적인 OCR 혼동을 조심하세요.
이런 때 씁니다
- 스캔한 계약서나 편지에서 한 단락을 복사할 때
- 스캔본으로만 남은 오래된 책이나 기사의 글을 얻을 때
- 스캔한 영수증이나 청구서를 메모에서 검색할 수 있게 만들 때
- 스캔한 논문과 유인물에서 인용문을 뽑을 때
- 서식과 기록을 손으로 다시 치지 않고 옮길 때
- 팩스로 받은 문서를 편집할 수 있게 바꿀 때
알아두면 좋은 점
- 암호가 걸린 PDF는 먼저 잠금을 풀어야 합니다 — PDF 잠금 해제를 이용하세요
- 큰 문서는 시간이 걸립니다. 컴퓨터에서 페이지당 2–10초 정도, 휴대폰에서는 더 걸립니다. 페이지로 필요한 부분만 읽으세요
- 중지해도 이미 읽은 페이지는 모두 남습니다
- 결과는 일반 텍스트입니다. Word에 넣으려면 붙여 넣거나, 이미 글자가 있는 PDF라면 PDF를 워드로를 이용하세요
- 모든 페이지에 진짜 글자가 있는 PDF라면 PDF를 텍스트로가 더 빠르고 레이아웃 옵션도 많습니다
자주 묻는 질문
무료인가요?
네. 가입 없음, 페이지 제한 없음, 워터마크 없음입니다.
PDF가 업로드되나요?
아니요. 페이지를 그리고 읽는 일은 모두 이 페이지 안, 사용자의 기기에서 이루어집니다.
어떤 언어를 읽을 수 있나요?
영어, 스페인어, 프랑스어, 독일어, 이탈리아어, 포르투갈어, 네덜란드어, 중국어(간체), 일본어, 한국어입니다. 시작하기 전에 하나를 고르세요.
왜 글자에 오류가 있나요?
OCR은 모양을 보고 글자를 하나씩 추측합니다. 흐릿하거나 비뚤어졌거나 해상도가 낮은 스캔은 잘못 추측하는 일이 많아집니다. 결과를 확인하고, 복사하기 전에 상자 안에서 몇 군데 오류를 고치세요.
PDF를 검색 가능하게 만들 수 있나요?
아직은 안 됩니다. 글자는 별도의 .txt 파일로 드립니다. 원본 PDF는 바뀌지 않습니다.
사용 방법
- 클릭해서 업로드를 클릭하거나, 스캔한 PDF를 상자로 끌어다 놓습니다
- 글자의 언어를 고릅니다
- 일부 페이지만 필요하면 페이지 범위를 입력합니다. 전체라면 비워 두세요
- 글자 읽기를 클릭하고 페이지가 하나씩 읽히는 것을 지켜봅니다
- 글자를 확인한 뒤 복사 또는 .txt 내려받기를 클릭합니다