Skip to main content
QUICK REVIEW

[논문 리뷰] Transformer-based HTR for Historical Documents

Phillip Ströbel, Simon Clematide|arXiv (Cornell University)|2022. 03. 21.
Natural Language Processing Techniques인용 수 5
한 줄 요약

이 논문은 사전에 훈련된 TrOCR 모델—비전 및 언어 트랜스포머 아키텍처—를 초기 현대 라틴 수기문서에 대해 미세조정하여 수기 텍스트 인식(HTR)을 위한 제안을 한다. 사전 훈련 기간 동안 라틴어나 역사적 수기 스타일을 한 번도 접하지 못했음에도 불구하고, TrOCR LARGE는 루도르프 가우트러의 시에서 2.55%의 CER를 기록했고, 하이너히 브류링거의 서신에서는 16.53%의 CER를 기록하여, 다수의 저자로 구성된 테스트 세트에서 강력한 HTR+ 기준 모델보다 4.6个百分点 높은 성능을 보이며, 새로운 수기 스타일과 언어로의 강력한 제로샷 전이 능력을 입증한다.

ABSTRACT

We apply the TrOCR framework to real-world, historical manuscripts and show that TrOCR per se is a strong model, ideal for transfer learning. TrOCR has been trained on English only, but it can adapt to other languages that use the Latin alphabet fairly easily and with little training material. We compare TrOCR against a SOTA HTR framework (Transkribus) and show that it can beat such systems. This finding is essential since Transkribus performs best when it has access to baseline information, which is not needed at all to fine-tune TrOCR.

연구 동기 및 목표

  • 사전에 영문 인쇄체 및 합성 수기 텍스트로 훈련된 TrOCR 모델이 자원이 적고 역사적으로 다양성이 있는 라틴 수기문서로 일반화 가능한지 평가하는 것.
  • TrOCR가 라틴어나 역사적 수기 스타일에 대한 사전 노출 없이도 초기 현대 수기문서에서 높은 HTR 성능을 달성할 수 있는지 평가하는 것.
  • 단일 저자 및 다수 저자 수기자료 모음에서 TrOCR의 성능을 강력한 HTR+ 기준 모델과 비교하는 것.
  • 디지털 인문학 분야에서 다양한 이질적인 수기자료 모음에 대해 TrOCR가 견고하고 이식 가능한 HTR 모델로 활용될 잠재력을 탐구하는 것.

제안 방법

  • 4,037줄의 16세기 루도르프 가우트러의 시집과 16,584줄의 하이너히 브류링거의 서신으로 구성된 두 개의 라틴 수기자료 세트에 대해 TrOCR BASE 및 TrOCR LARGE 모델을 미세조정하였다.
  • TrOCR의 사전 훈련된 비전 인코더(BEiT)와 RoBERTa 기반 디코더를 사용하였으며, ImageNet-1K 사전 훈련을 기반으로 하여 수기 이미지와 전사본에 대해 미세조정하였다.
  • 스캔된 수기자료에서 선별 수준의 이미지-텍스트 정렬을 추출하기 위해 Transkribus를 활용해 데이터 증강 및 레이아웃 분석을 실시하였다.
  • Gwalther 데이터셋에서는 최대 50 에포크, Bullinger 데이터셋에서는 최대 20 에포크 동안 훈련하였으며, 조기 정지와 검증 모니터링을 적용하였다.
  • 검증 및 테스트 세트에서 문자 오류율(CER)을 사용해 성능을 평가하였으며, TrOCR와 HTR+ 기준 모델 간의 성능을 비교하였다.
  • Gwalther 데이터셋은 3,603/433 비율로, Bullinger 데이터셋은 13,843/1,685/1,056 비율로 분할하여 강력한 평가를 확보하였다.

실험 결과

연구 질문

  • RQ1TrOCR는 사전 훈련 과정에서 라틴어나 역사적 수기 스타일을 접하지 못했음에도 불구하고 라틴 수기자료로 일반화 가능한가?
  • RQ2TrOCR는 자원이 적고 다수의 저자가 포함된 수기자료 모음에서 HTR+와 같은 기존 HTR 모델을 초월할 수 있는가?
  • RQ3미세조정 기간이 다양하고 스타일이 다른 역사적 수기 텍스트에서 TrOCR의 성능에 어떤 영향을 미치는가?
  • RQ4기존의 HTR 모델과 달리, TrOCR는 기본 정보 없이도 뛰어난 성능을 달성할 수 있는가?
  • RQ5더 큰 TrOCR LARGE 아키텍처는 다양한 수기자료에서 TrOCR BASE를 일관되게 뛰어넘는가?

주요 결과

  • 루도르프 가우트러의 시에 대한 검증 세트에서 TrOCR LARGE는 2.55%의 CER를 기록하여 HTR+ 기준 모델의 2.74%보다 0.19个百分点 높은 성능을 보였다.
  • 다수 저자로 구성된 브류링거의 서신 데이터셋에서 TrOCR LARGE는 테스트 세트에서 16.53%의 CER를 기록하여 HTR+ 기준 모델의 21.13%보다 4.60个百分点 높은 성능을 보였다.
  • TrOCR LARGE 모델는 더 긴 미세조정 기간 동안 지속적인 성능 향상을 보였으며, Gwalther 데이터에서 15 에포크에 최고 성능(2.55% CER)을 기록하였다.
  • TrOCR BASE는 10 에포크를 초과해도 성능이 저하되는 경향을 보였으며, 이는 이 데이터셋에서 과적합 또는 최적화되지 않은 학습 동역학을 시사한다.
  • 사전 훈련 과정에서 라틴어나 초기 현대 수기 스타일을 한 번도 접하지 못했음에도 불구하고, TrOCR LARGE는 단일 저자 및 다수 저자 수기자료 모음 모두에 효과적으로 일반화되었다.
  • 결과적으로 TrOCR는 새로운 언어와 수기 스타일로의 제로샷 적응이 가능한 매우 이식 가능한 HTR 모델임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.