Skip to main content
QUICK REVIEW

[논문 리뷰] Lights, Camera, Action! A Framework to Improve NLP Accuracy over OCR documents

Amit Gupte, Alexey Romanov|arXiv (Cornell University)|2021. 08. 06.
Topic Modeling참고 문헌 25인용 수 4
한 줄 요약

이 논문은 합성 데이터 생성 파이프라인(Genalog)과 동작 예측 기반 텍스트 복원 모델을 사용하여 OCR 처리된 문서에서 NLP 정확도를 향상시키는 프레임워크를 제안한다. 이 방법은 정확도 저하를 크게 줄이며, 특히 NER 정확도 저하를 최대 73% 감소시켜, OCR 오류가 발생한 텍스트를 복원함으로써 정상 텍스트로 복원함으로써 효과를 발휘한다. 이는 도메인 외부 데이터로의 일반화 가능성까지 확보한다.

ABSTRACT

Document digitization is essential for the digital transformation of our societies, yet a crucial step in the process, Optical Character Recognition (OCR), is still not perfect. Even commercial OCR systems can produce questionable output depending on the fidelity of the scanned documents. In this paper, we demonstrate an effective framework for mitigating OCR errors for any downstream NLP task, using Named Entity Recognition (NER) as an example. We first address the data scarcity problem for model training by constructing a document synthesis pipeline, generating realistic but degraded data with NER labels. We measure the NER accuracy drop at various degradation levels and show that a text restoration model, trained on the degraded data, significantly closes the NER accuracy gaps caused by OCR errors, including on an out-of-domain dataset. For the benefit of the community, we have made the document synthesis pipeline available as an open-source project.

연구 동기 및 목표

  • NLP 모델 훈련을 위한 레이블이 부여된 품질이 떨어지는 OCR 문서의 부족 문제를 해결하기 위해, NER 애너테이션을 유지한 채 실제와 유사한 OCR 영향을 받은 문서를 생성하는 합성 문서 생성 파이프라인(Genalog)을 개발한다.
  • 특히 텍스트 품질 저하로 인해 정확도가 급격히 떨어지는 명명된 실체 인식(NER)과 같은 후행 NLP 작업에 영향을 최소화하기 위해 OCR 오류의 부정적 영향을 완화한다.
  • 특수 작업에 맞는 미세조정 없이도 OCR 출력에서 정제된 텍스트를 재구성할 수 있는 일반화 능력이 뛰어난 텍스트 복원 모델을 개발한다.
  • 다양한 OCR 품질 저하 수준과 도메인 외부 데이터셋에서의 성능 평가를 통해 프레임워크의 강건성과 일반화 능력을 평가한다.
  • 향후 문서 지능 및 OCR 오류 완화 연구를 지원하기 위해 합성 문서 생성 파이프라인(Genalog)을 오픈소스로 공개한다.

제안 방법

  • 원본 텍스트에서 이미지로의 합성 문서 생성을 가능하게 하는 Genalog 파이프라인을 설계 및 구현한다. 이는 실제적인 OCR 저하(예: 블러, 노이즈, 번짐)를 적용하고, 이미지에 대해 OCR을 수행하며, 원본 텍스트의 NER 애너테이션을 OCR 출력으로 전파한다.
  • 노이즈가 있는 OCR 텍스트를 정제된 텍스트로 매핑하기 위해 토큰 수준에서 수정 동작(삽입, 삭제, 치환 등)을 예측하는 순서-순서(sequence-to-sequence) 기반의 동작 예측 모델을 훈련한다.
  • 자세한 서브워드 수준 오류를 고려하여 강건성을 확보하기 위해 토큰 수준과 문자 수준에서 동시에 작동하는 다중 작업 Bi-LSTM 모델을 NER에 적용한다.
  • 정제된 텍스트와 노이즈가 있는 텍스트 쌍을 동적 프로그래밍을 사용해 정렬함으로써 모델 훈련 중 레이블 일관성을 유지한다.
  • NER 모델에 입력하기 전에 OCR 출력을 복원하기 위해 동작 예측 모델을 적용함으로써 종단 간 오류 보정을 실현한다.
  • CoNLL-2003, CoNLL-2012, CNN 등 다양한 데이터셋과 저하 수준을 사용하여 프레임워크의 성능을 평가하고, NER 성능 향상을 F1 스코어로 측정한다.

실험 결과

연구 질문

  • RQ1다양한 문서 품질 수준에서 OCR 저하가 NER 성능에 얼마나 영향을 미치는가?
  • RQ2합성된 저하된 OCR 데이터로 훈련된 텍스트 복원 모델이 실제 세계의 OCR 출력에서 NER 정확도를 효과적으로 복원할 수 있는가?
  • RQ3훈련 중에 볼 수 없었던 도메인 외부 문서에 대해 동작 예측 모델의 일반화 능력은 어느 정도인가?
  • RQ4다양한 저하 강도에서 복원된 텍스트를 사용했을 때와 원본 OCR 출력을 사용했을 때의 NER F1 스코어 향상 정도는 어떻게 비교되는가?
  • RQ5OCR 오류로 인한 정렬 불일치 문제를 다룰 때, 동작 예측 접근 방식이 기존의 seq2seq 모델보다 우수한가?

주요 결과

  • OCR 저하로 인해 NER 정확도가 심각하게 저하되며, 정제된 CoNLL-2003 텍스트의 F1 스코어 0.860에서 노이즈가 있는 텍스트로의 F1 스코어 0.820으로 떨어지며 4.6% 포인트 감소한다.
  • 경미한 저하 조건에서 CoNLL-2012에서는 최대 73%의 NER 정확도 갭을 복원하고, CoNLL-2003에서는 52%를 복원함으로써 표준 데이터셋에서 뛰어난 성능을 보였다.
  • 인간 레이블이 없는 CNN 데이터셋(모델 생성 기준 진실값 사용)에서는 노이즈가 있는 텍스트에서 NER F1 스코어가 0.989에서 0.590으로 떨어지며, 복원 모델이 이 정확도 갭의 76%를 복원하였다.
  • 모델은 중간 수준의 저하 조건에서 가장 우수한 성능을 보였으며, 파편화된 오류와 모든 저하(경미한) 설정에서 최대 77%의 갭 감소를 기록했지만, 중첩된 심각한 저하에서는 성능이 약간 떨어졌다.
  • 가장 심각한 저하 설정(모든 저하가 강도 높은 모드)에서는 동작 예측 모델이 NER 정확도 갭을 19% 감소시켜 극심한 OCR 노이즈 조건에서도 강건성을 입증했다.
  • 프레임워크는 도메인 외부 데이터로도 효과적으로 일반화되며, 해당 도메인에 대해 미세조정 없이도 복원 모델이 새로운 CNN 기사에서 NER 성능을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.