pdf-inspector - OCR이 필요한 PDF만 골라내는 도구
·
알쓸신잡
문서 파싱 작업을 하면서 항상 고민이 하나 있었다. 최근 나온 VLM들을 보면 OCR 성능이 정말 많이 올라왔다. 복잡한 문서 구조도 예전보다 훨씬 잘 잡는다. 다만 학습이나 평가는 대부분 영어와 중국어 위주라 한국어에서는 가끔씩 세세한 오타가 발생한다. 보통은 그냥 넘어갈 만한 오타지만, 문서 파싱에서는 한 글자 차이가 치명적으로 다가올 때가 있다. 그래서 이미지로 된 스캔본이 아니라 텍스트가 들어 있는 PDF라면 최대한 PyPDF나 pypdfium2 같은 단순 파싱 라이브러리를 쓰고 싶었다. 이미 PDF 안에 원문 텍스트가 있는데 굳이 다시 이미지로 렌더링하고 OCR을 태우면서 오타 가능성을 만들 필요는 없기 때문이다. 문제는 자동화였다. PDF를 직접 열어보기 전에는 이게 텍스트 기반인지, 스캔본인..