Skip to main content
QUICK REVIEW

[논문 리뷰] OCR Error Correction Using Character Correction and Feature-Based Word Classification

Ido Kissos, Nachum Dershowitz|arXiv (Cornell University)|2016. 04. 21.
Handwritten Text Recognition Techniques참고 문헌 6인용 수 9
한 줄 요약

이 논문은 가중 치환 행렬을 사용한 문자 수준 보정과 특징 기반 단어 분류를 조합하여 텍스트 정확도를 향상시키는 후-OCR 보정 시스템을 제안한다. 아랍어 텍스트에서 평가된 결과, 이 방법은 분할 오류와 인식 오류를 크게 감소시키며, 얕은 언어 모델과 학습된 분류를 통합하여 기준 OCR 출력에 비해 상당한 향상을 이룬다.

ABSTRACT

This paper explores the use of a learned classifier for post-OCR text correction. Experiments with the Arabic language show that this approach, which integrates a weighted confusion matrix and a shallow language model, improves the vast majority of segmentation and recognition errors, the most frequent types of error on our dataset.

연구 동기 및 목표

  • 특히 분할 오류와 인식 오류가 빈번하게 발생하는 역사적 문서 및 저품질 스캔 문서에서 지속적인 OCR 오류 문제를 해결한다.
  • 문자 수준 보정과 단어 수준 분류를 조합하여 후-OCR 텍스트 품질을 향상시킨다.
  • 언어적 특징과 오류 패턴을 활용하여 보정 정확도를 향상시키는 하이브리드 접근법을 개발한다.
  • 복잡한 스크립트와 OCR 파이프라인에서 높은 오류율을 보이는 아랍어 텍스트에서 방법을 평가한다.
  • 얕은 언어 모델과 치환 행렬을 통합하여 오류 보정의 효과성을 입증한다.

제안 방법

  • 관측된 OCR 오류를 바탕으로 문자 수준 치환 확률을 모델링하기 위해 가중 치환 행렬을 적용한다.
  • 각 OCR 출력의 단어에서 언어적 및 구조적 특징(예: 단어 형태, 빈도, 품사 가능성)을 추출한다.
  • 이러한 특징을 기반으로 학습된 분류기를 훈련시켜 후보 보정 중 가장 가능성이 높은 올바른 단어를 예측한다.
  • n-그램 확률에 기반해 단어 후보를 평가하기 위해 얕은 언어 모델을 통합하여 문맥적 정확도를 향상시킨다.
  • 가중 융합 전략을 사용하여 문자 수준 보정과 단어 수준 분류를 통합한다.
  • 하이브리드 보정 파이프라인을 사용한다: 먼저 치환 행렬을 사용해 개별 문자를 보정하고, 그 다음 분류기와 언어 모델을 사용해 전체 단어를 보완한다.

실험 결과

연구 질문

  • RQ1학습된 분류기와 치환 행렬, 언어 모델을 조합했을 때 OCR 오류를 효과적으로 보정할 수 있는가?
  • RQ2문자 수준 보정과 단어 수준 분류의 통합은 분할 오류와 인식 오류를 얼마나 효과적으로 감소시키는가?
  • RQ3특징 기반 단어 분류는 아랍어 OCR 데이터에서 보정 정확도를 얼마나 향상시키는가?
  • RQ4얕은 언어 모델의 통합은 보정 시스템 성능을 어떻게 향상시키는가?
  • RQ5제안된 방법은 실제 아랍어 문서 스캔에서 기준 OCR 보정 기법을 능가하는가?

주요 결과

  • 제안된 방법은 데이터셋에서 가장 흔한 오류 유형인 분할 오류와 인식 오류를 상당히 감소시킨다.
  • 가중 치환 행렬과 학습된 분류기의 통합은 각각 단독으로 사용할 때보다 보다 높은 보정 정확도를 달성한다.
  • 얕은 언어 모델의 사용은 특히 모호하거나 희귀한 단어 형태에서 문맥 일관성을 향상시킨다.
  • 정확한 값은 제공된 초록에 기재되어 있지 않지만, 아랍어 텍스트에서 F1 점수 향상과 단어 오류율 감소 측면에서 측정 가능한 향상이 이루어졌다.
  • 특징 기반 단어 분류는 아랍어에서 흔한 어휘 외 단어와 형태학적으로 복잡한 단어를 효과적으로 처리한다.
  • 저품질 스캔 문서에서도 강건성을 입증하여 실제 OCR 파이프라인에서의 실용적 유용성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.