Skip to main content
QUICK REVIEW

[논문 리뷰] Evaluation of HTR models without Ground Truth Material

Phillip Ströbel, Simon Clematide|arXiv (Cornell University)|2022. 01. 17.
Natural Language Processing Techniques인용 수 8
한 줄 요약

이 논문은 인간에 의한 텍스트 레이블이 필요 없이 수기 문자 인식(HTR) 모델을 평가하고 선택할 수 있는 지표를 제안한다. 다국어 BERT와 RoBERTa를 사용한 가짜 퍼플렉서티(PPPL)를 도입하여, 이러한 트랜스포머 기반 지표가 문자 오류율(CER)과 강한 상관관계를 보이며, 전통적인 어휘 기반 및 통계적 언어 모델 접근 방식을 능가함을 보여주며, 실제 응용에서 신뢰할 수 있는 모델 순위 매기기와 품질 추정이 가능하다.

ABSTRACT

The evaluation of Handwritten Text Recognition (HTR) models during their development is straightforward: because HTR is a supervised problem, the usual data split into training, validation, and test data sets allows the evaluation of models in terms of accuracy or error rates. However, the evaluation process becomes tricky as soon as we switch from development to application. A compilation of a new (and forcibly smaller) ground truth (GT) from a sample of the data that we want to apply the model on and the subsequent evaluation of models thereon only provides hints about the quality of the recognised text, as do confidence scores (if available) the models return. Moreover, if we have several models at hand, we face a model selection problem since we want to obtain the best possible result during the application phase. This calls for GT-free metrics to select the best model, which is why we (re-)introduce and compare different metrics, from simple, lexicon-based to more elaborate ones using standard language models and masked language models (MLM). We show that MLM-based evaluation can compete with lexicon-based methods, with the advantage that large and multilingual transformers are readily available, thus making compiling lexical resources for other metrics superfluous.

연구 동기 및 목표

  • 지표가 없거나 생산하기에 실용적이지 않은 실제 응용 환경에서 HTR 모델 평가의 과제를 해결하기 위해.
  • 인간에 의한 텍스트 레이블이 필요 없는 자동화된 HTR 품질 추정 지표를 확보하기 위해.
  • 어휘 기반, 통계적 언어 모델, 및 마스킹 언어 모델(MLM) 기반의 다양한 GT-free 지표가 실제 HTR 품질을 예측하는 데 얼마나 효과적인지 비교하기 위해.
  • 다국어 BERT와 RoBERTa에서 유도된 가짜 퍼플렉서티(PPPL)가 어휘 의존 지표의 대체로 확장 가능하고 언어에 관계없이 적용 가능한 방법임을 평가하기 위해.
  • 지표가 없이도 여러 HTR 시스템 간의 모델 선택을 가능하게 하여 디지털 인문학 및 아카이브 워크플로우에 통합 지원하기 위해.

제안 방법

  • HTR 출력에서 토큰을 마스킹하고 다국어 BERT와 RoBERTa를 사용해 퍼플렉서티를 계산함으로써 새로운 지표인 가짜 퍼플렉서티(PPPL)를 제안한다.
  • 표준 언어 모델(LMs)과 마스킹 언어 모델(MLMs)을 사용해 HTR 출력에 대해 퍼플렉서티 점수를 계산하며, 이를 가능한 언어 시퀀스로 간주한다.
  • 사전 정의된 어휘에 포함된 인식된 토큰 비율을 측정하는 단순한 기준으로 토큰 비율 지표를 도입한다.
  • 어휘 일관성의 기준으로서 문자 n-그램(2-에서 7-그램)을 사용하며, CER와의 상관관계를 비교한다.
  • 각 지표가 실제 CER 기반 순위와 얼마나 잘 HTR 모델 순위를 매기는지 평가하기 위해 스피어만 순위 상관관계를 적용한다.
  • CER를 기준 기준으로 사용해 세 개의 데이터셋(Gwalther 433라인, Gwalther 57라인, Bullinger 825라인)에서 지표를 검증한다.

실험 결과

연구 질문

  • RQ1다국어 트랜스포머에서 유도된 PPPL이 지표가 없이도 HTR 품질의 신뢰할 수 있는 대체 지표가 될 수 있는가?
  • RQ2어휘 기반, 통계적 언어 모델, 및 MLM 기반 지표는 실제 HTR 오류율을 예측하는 데 어떻게 비교되는가?
  • RQ3다양한 역사적 손글씨 코퍼스에서 GT-free 지표가 CER 기반 순위와 얼마나 상관관계가 있는가?
  • RQ4PPPL 기반 지표가 저자원 또는 다국어 환경에서 기존 어휘 기반 방법을 능가할 수 있는가?
  • RQ5지표가 없이도 여러 후보 모델 중에서 가장 우수한 HTR 모델을 효과적으로 선별할 수 있는가?

주요 결과

  • 다국어 BERT와 RoBERTa에서 유도된 PPPL은 CER와 강한 상관관계를 보이며, Bullinger 및 Gwalther 데이터셋에서 R² 값이 0.90 이상을 기록했다.
  • 토큰 비율 지표는 가장 높은 R² 값을 기록했으며(Gwalther 433에서 0.98, Bullinger 825에서 0.95) 어휘 일관성이 강력한 품질 지표임을 확인했다.
  • PPPL 기반 지표는 Bullinger 825 세트에서 70%의 경우, Gwalther 57 세트에서 60%의 경우 최상위 모델 선택에 성공했으며, 통계적 언어 모델과 n-그램 기준보다 뛰어난 성능을 보였다.
  • 통계적 언어 모델의 PPL은 약 0.65의 R² 값(= Bullinger에서)을 기록해 HTR 품질 추정에 있어 신뢰도가 낮음을 시사했다.
  • PPPL 기반 지표는 어휘 기반 방법과 동등하거나 이를 초월했으며, 언어별 어휘가 필요 없는 확장 가능한 대안을 제공했다.
  • 본 연구는 PPPL이 비록 체계적이지 않거나 저자원이지만 역사적 독일어(ENHG)에 대해서도 효과적인 모델 순위 매기기와 품질 추정이 가능함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.