스캔한 PDF에서 텍스트 추출(OCR)하는 방법

스캔한 PDF에서 텍스트 추출(OCR)하는 방법

스캔한 PDF나 이미지 기반 PDF에서 OCR로 텍스트를 인식·추출하는 방법을 정리했습니다.

Adobe Acrobat과 무료 프로그램을 이용한 절차, 인식률을 높이는 방법을 다룹니다.

스캔한 PDF에서 텍스트 추출(OCR)하는 방법

스캐너로 만든 PDF나 사진을 찍어 저장한 PDF는 화면에 글자가 보여도 실제로는 이미지 한 장으로 저장되어 있다.

이런 파일은 텍스트를 선택하거나 검색할 수 없고, 다른 문서에 붙여넣을 수도 없다.

OCR(광학 문자 인식)을 이용하면 이미지 속 글자를 인식해 선택·검색·복사가 가능한 텍스트로 바꿀 수 있다.

스캔 PDF에서 텍스트 추출

PDF24 Creator로 OCR 처리하기

  1. PDF24 Creator에 스캔한 PDF 파일을 추가한다.
  2. 도구 목록에서 ‘OCR’을 선택한다.
  3. 인식 언어를 한국어로 지정한다.
  4. 처리를 실행하고 결과 파일을 저장한다.

처리가 끝나면 원본 스캔 이미지 위에 인식된 텍스트가 보이지 않는 레이어 형태로 겹쳐진다. 화면에 보이는 모양은 그대로 유지되면서 텍스트 선택과 검색만 가능해지는 방식이다.

Windows 기본 기능으로 간단히 처리하기

페이지 전체가 아니라 일부 구간만 텍스트로 옮기고 싶다면 Windows에 기본 내장된 기능을 활용할 수 있다.

PDF 페이지를 캡처 도구로 이미지로 저장한 뒤, Microsoft OneNote에 붙여넣고 마우스 오른쪽 버튼에서 ‘그림에서 텍스트 복사’를 선택하면 짧은 문단을 빠르게 텍스트로 옮길 수 있다.

문서 전체를 변환해야 한다면 PDF24 Creator처럼 PDF 전용 OCR 도구를 사용하는 것이 효율적이다.

인식률을 높이는 방법

  • 스캔 해상도는 300dpi 이상으로 설정한다.
  • 문서를 최대한 수평으로 맞춰 스캔한다.
  • 배경이 어둡거나 그림자가 있는 사진은 인식률이 떨어진다.
  • 손글씨는 인쇄체보다 인식 정확도가 크게 낮다.

자주 묻는 질문

한글 인식이 잘 안 될 때는 어떻게 하는가?

OCR 언어 설정이 한국어로 지정되어 있는지 먼저 확인해야 한다. 영어로 설정된 상태에서는 한글 인식률이 크게 떨어진다.

OCR 처리 후 원본 스캔 이미지가 사라지는가?

대부분의 OCR 도구는 원본 이미지를 유지한 채 텍스트 레이어만 추가하는 방식이므로, 문서의 겉모습은 처리 전과 동일하게 유지된다.

함께 보면 좋은 글