Skip to main content
QUICK REVIEW

[논문 리뷰] Automatic quality evaluation and (semi-) automatic improvement of mixed models for OCR on historical documents.

Uwe Springmann, Florian Fink|arXiv (Cornell University)|2016. 06. 16.
Handwritten Text Recognition Techniques참고 문헌 9인용 수 9
한 줄 요약

이 논문은 초기 혼합 모델 OCR 시스템에서 유도된 문자 신뢰도 및 어휘성 점수를 활용하여 역사적 문서의 OCR 정확도를 향상시키는 반자동 방법을 제안한다. 최소한의 지도 데이터로 40~80줄의 수동 수정된 라인만을 사용하여, 몇 퍼센트 내외의 문자 오류율을 달성하며, 사전에 글꼴 특화 모델링 없이 다양한 인쇄 스타일에 대비하여 수동 편집 작업의 부담을 크게 줄인다.

ABSTRACT

Good OCR results on historical documents rely on diplomatic transcriptions of printed material as ground truth which is both a scarce resource and time-consuming to generate. A strategy is proposed which starts from a mixed model trained on already available transcriptions from different centuries giving accuracies over 90% on a test set from the same period of time, overcoming the typography barrier of having to train individual models separately for each historical typeface. It is shown that both mean character confidence (as output by the OCR engine OCRopus) and lexicality (a measure of correctness of OCR tokens compared to a lexicon of modern wordforms taking historical spelling patterns into account, which can be calculated for any OCR engine) correlate with true accuracy determined from a comparison of OCR results with ground truth. These measures are then used to guide the training of new individual OCR models either using OCR prediction as pseudo ground truth (fully automatic method) or choosing a minimum set of hand-corrected lines as training material (manual method). Already 40-80 hand- corrected lines lead to OCR results with character error rates of only a few percent. This procedure minimizes the amount of ground truth production and does not depend on the previous construction of a specific typographic model.

연구 동기 및 목표

  • 역사적 문서의 정확한 OCR 시스템을 훈련하기 위해 필요한 외교적 편집본의 부족과 높은 비용 문제를 해결하기 위해.
  • 각 역사적 글꼴에 대해 별도의 모델이 필요로 하는 제약을 혼합 모델 접근법을 통해 극복하기 위해.
  • 다양한 역사적 글자체에서 높은 OCR 정확도를 달성하면서도 수동 지도 데이터 생산을 최소화하는 방법을 개발하기 위해.
  • OCR 엔진 출력물(신뢰도 및 어휘성)이 전체 지도 데이터가 없이도 진짜 OCR 정확도를 신뢰성 있게 예측할 수 있는지 평가하기 위해.

제안 방법

  • 여러 세기의 편집본을 기반으로 초기 혼합 모델 OCR 시스템을 훈련하여, 기간 내 테스트 세트에서 90% 이상의 정확도를 달성한다.
  • 모델 개선 과정에서 OCRopus가 생성한 평균 문자 신뢰도를 OCR 신뢰성의 대체 지표로 사용한다.
  • OCR 토큰을 현대 어휘 형태의 어휘집과 비교하여 어휘성을 계산하며, 역사적 철자 변형을 고려한다.
  • 신뢰도 및 어휘성 점수를 활용해 고품질의 OCR 예측 결과를 가짜 지도 데이터로 선별하여 새로운 개별 모델을 훈련한다.
  • 수동으로 40~80줄의 수동 수정된 라인만 선택하여 모델을 보정하는 방법을 적용함으로써 광범위한 지도 데이터 의존도를 감소시킨다.
  • 신뢰도 및 어휘성을 반복적으로 활용하여 완전 자동 및 반자동 훈련 파이프라인 양쪽 모두에서 OCR 모델을 향상시킨다.

실험 결과

연구 질문

  • RQ1OCR 엔진에서 유도된 문자 신뢰도 및 어휘성 점수는 전체 지도 데이터가 없이도 진짜 OCR 정확도를 신뢰성 있게 예측할 수 있는가?
  • RQ2OCR 출력물에서 파생된 가짜 지도 데이터가 역사적 문서의 개별 모델 성능 향상에 얼마나 기여하는가?
  • RQ3역사적 텍스트의 OCR에서 낮은 문자 오류율을 달성하기 위해 얼마나 적은 수의 수동 수정 라인이 필요한가?
  • RQ4단일 혼합 모델 OCR 시스템은 다양한 역사적 시대와 글꼴 간에 잘 일반화되는가?
  • RQ5신뢰도 및 어휘성 지표의 조합은 OCR 개발에서 광범위한 수동 편집의 필요성을 줄일 수 있는가?

주요 결과

  • 평균 문자 신뢰도 및 어휘성 점수는 진짜 OCR 정확도와 강하게 상관관계가 있어, 전체 지도 데이터가 없더라도 신뢰할 수 있는 품질 평가가 가능하다.
  • OCR 예측 결과를 가짜 지도 데이터로 사용할 경우, 최소한의 인간 간섭으로도 모델 성능 향상이 크게 이루어진다.
  • 오직 40~80줄의 수동 수정된 라인만으로도 문자 오류율이 몇 퍼센트 내외로 떨어지는 새로운 OCR 모델을 훈련시킬 수 있다.
  • 이 방법은 글꼴 다양성에 대비하는 장벽을 효과적으로 극복하여, 사전에 특정 글꼴에 특화된 모델링 없이도 다양한 역사적 글꼴에서 높은 정확도를 달성한다.
  • 대규모 외교적 편집본이 필요로 하는 양을 줄여, 역사적 문서의 OCR 개발이 보다 확장 가능하고 효율적으로 만들 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.