[논문 리뷰] CITlab ARGUS for historical handwritten documents
이 논문은 tranScriptorium 데이터셋으로부터 역사적 손글씨 문서를 인식하기 위한 MDRNN(다차원 순환 신경망)과 CTC(연결주의 시간 분류) 기반 시스템인 CITlab ARGUS를 제시한다. 이 시스템은 신경망 신뢰도 행렬과 다수의 디코딩 전략(사전 모델 및 앙상블 방법 포함)을 융합한 하이브리드 접근법을 사용하여 강력한 사전처리 및 고도의 디코딩 기법을 통해 HTRtS 2015 경쟁에서 최고 성능을 기록하였다.
We describe CITlab's recognition system for the HTRtS competition attached to the 13. International Conference on Document Analysis and Recognition, ICDAR 2015. The task comprises the recognition of historical handwritten documents. The core algorithms of our system are based on multi-dimensional recurrent neural networks (MDRNN) and connectionist temporal classification (CTC). The software modules behind that as well as the basic utility technologies are essentially powered by PLANET's ARGUS framework for intelligent text recognition and image processing.
연구 동기 및 목표
- 스クリ프트의 높은 변동성과 열악한 품질로 인해 어려움을 겪는 역사적 문서에 특화된 강력한 손글씨 텍스트 인식 시스템을 개발하기 위해.
- 일관되지 않은 줄 간격, 기울기, 잉크 품질을 가진 역사적 수기문서에서 손글씨 텍스트를 인식하는 데 도전하기 위해.
- 신경망 모델링과 지능적인 디코딩 전략의 조합을 통해 정확도를 향상시키기 위해.
- 확장 가능하고 모듈러한 텍스트 인식 파이프라인 개발을 위한 PLANET ARGUS 프레임워크를 활용하기 위해.
- 최적의 전사 성능을 위해 사전 모델 및 앙상블 방법을 포함한 다양한 디코딩 체계를 평가하고 비교하기 위해.
제안 방법
- 표준 사전처리 후 선 폴리곤 이미지를 처리하며, 대trast 정규화, 크기 조정, 글쓰기 정규화를 포함하여 선 높이를 96px로 표준화한다.
- 전체 선 이미지를 분할 없이 처리하는 순차 처리 순환 신경망(SPRNN)이 각 이미지 위치에서 문자 확률을 추정하는 신뢰도 행렬을 생성한다.
- 신뢰도 행렬은 여러 디코딩 체계를 사용하여 디코딩된다: 최적 경로(Dec-BP), CITlab 표현 디코딩(Dec-CE), 사전 모델 디코딩(Dec-DM), n-전문가 위원회(Dec-E<n>) (n=2에서 5까지).
- Dec-DM 체계는 훈련 데이터에서의 단어 빈도 데이터를 통합하여 더 가능성 있는 단어 조합을 선호함으로써 정확도를 향상시킨다.
- Dec-E<n> 체계는 검증 성능 기준으로 상위 n개의 SPRNN 출력을 조합하여 공통된 알고리즘을 사용함으로써 강건성을 향상시킨다.
- 훈련은 두 가지 체계를 사용함: trn-1(첫 번째 배치의 10,491줄)과 trn-2(추가 페이지에서 추출한 3,968줄을 더해 총 14,479줄로 확장), 하이퍼파라미터는 검증 세트에서 경사 하강법과 조기 정지 기법을 통해 최적화되었다.
실험 결과
연구 질문
- RQ1복잡한 스크립트 변동성이 있는 역사적 손글씨 문서를 인식하는 데 다차원 순환 신경망과 CTC 훈련이 얼마나 효과적인가?
- RQ2표현 기반 규칙, 사전 모델, 앙상블 방법과 같은 다양한 디코딩 전략이 역사적 텍스트의 정확도에 얼마나 기여하는가?
- RQ3선 기울기, 기울기, 대trast를 정규화하는 통합 사전처리 파이프라인은 다양한 역사적 문서에서 인식 성능을 크게 향상시킬 수 있는가?
- RQ4디코딩에 단어 빈도 정보를 통합할 경우, 신뢰도 기반 디코딩에 비해 전사 품질은 어떻게 향상되는가?
- RQ5다수의 신경망 앙상블을 사용할 경우 개별 모델 대비 성능 향상은 얼마나 되는가?
주요 결과
- MDRNN와 고도의 디코딩 전략을 조합하여 HTRtS 2015 경쟁에서 최고 성능을 기록하였다.
- Dec-DM(사전 모델) 및 Dec-E<n> (n-전문가 위원회) 디코딩 체계가 Dec-BP 및 Dec-CE와 같은 간단한 방법보다 유의미하게 뛰어난 성능을 보였다.
- 추가로 추출한 선 폴리곤을 포함한 trn-2 데이터 사용은 trn-1만 사용한 경우보다 모델의 일반화 능력을 향상시켰다.
- n=5인 전문가 위원회 접근법이 가장 우수한 결과를 도출하여 역사적 손글씨에서의 불확실성 처리에 있어 앙상블 모델링의 가치를 입증하였다.
- Dec-DM에 단어 빈도 정보를 통합함으로써 희귀하거나 모호한 단어에 대해서도 더 자연스럽고 정확한 전사 결과를 도출할 수 있었다.
- SPRNN 기반의 신뢰도 행렬과 함께 NaC(비문자 기호) 탐지 기법을 활용함으로써 모호하거나 불확실한 문자 예측을 효과적으로 처리하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.