[논문 리뷰] System Description of CITlab's Recognition & Retrieval Engine for ICDAR2017 Competition on Information Extraction in Historical Handwritten Records.
이 논문은 ICDAR2017 경쟁 대회에서 고대 수기 결혼 기록을 위한 딥러닝 기반 인식 및 검색 시스템을 제시한다. 텍스트 인식에 CTC 손실을 사용하는 CNN-BLSTM 아키텍처를 활용하고, 수작업으로 설계한 정규표현식과 언어 사전 정보를 통해 구조화된 데이터(예: 이름, 위치 등)를 고정밀도로 추출한다. 결과적으로 남편 이름의 최상위 수준 문자 오류율은 96.17%이며, 부인 이름은 98.49%를 기록하였다.
We present a recognition and retrieval system for the ICDAR2017 Competition on Information Extraction in Historical Handwritten Records which successfully infers person names and other data from marriage records. The system extracts information from the line images with a high accuracy and outperforms the baseline. The optical model is based on Neural Networks. To infer the desired information, regular expressions are used to describe the set of feasible words sequences.
연구 동기 및 목표
- 제한된 레이블링된 훈련 데이터를 바탕으로 고대 수기 문서에서 정보 추출을 위한 강건한 시스템을 개발하는 것.
- 초기 현대 스페인어 수기 기록에서 나타나는 언어적 다양성과 철자 불일치 문제를 해결하는 것.
- 라인 수준의 이미지에서 개인 정보(예: 이름, 성, 위치 등)를 정확하게 인식하는 것.
- 신경망 기반 순서 인식과 정규표현식 및 어휘 사전 정보를 활용한 구조적 규칙 기반 디코딩을 조합함으로써 효과성을 입증하는 것.
제안 방법
- 배치 정규화와 드롭아웃를 적용한 CNN-BLSTM 신경망을 사용하여 CTC 손실을 활용해 전처리된 라인 이미지에서 순서-순서 텍스트 인식을 위한 학습을 수행한다.
- 이미지는 대trast 강화, 크기 정규화, 특허 기반 글쓰기 정규화를 거쳐 라인 높이를 96px로 중심화하고 표준화한다.
- 신경망의 출력 확률 행렬을 디코딩하기 위해 이중 단계 프로세스를 사용한다. 첫 번째 단계에서는 정규표현식을 통해 기록을 영역(예: 남편, 부인)으로 분할하고, 두 번째 단계에서는 어휘 사전 정보를 활용해 각 개인별 시퀀스를 하위 오토마타로 검증한다.
- 문자 수준의 사전 정보는 훈련 데이터에서의 상대어순 빈도를 기반으로 추정되며, 어휘 외 단어는 각 위치별 문자 확률로 처리된다.
- 최종 디코딩된 시퀀스는 신경망의 신뢰도와 시퀀스의 사전 확률의 곱을 최대화하도록 구성되며, 이는 서브워드 빈도로 근사화된다.
- 시스템은 이름, 성, 직업, 위치를 위한 사전 하위 오토마타를 포함한 맞춤형 오토마타를 사용하여 디코딩을 이끌고 신뢰도를 향상시킨다.
실험 결과
연구 질문
- RQ1딥러닝과 규칙 기반 정규표현식을 조합한 하이브리드 시스템이 노이즈가 많고 고대 수기 기록에서 구조화된 메타데이터를 고정밀도로 추출할 수 있는가?
- RQ2어휘 사전 정보와 문자 수준 언어 모델이 초기 현대 스페인어 수기에서 희귀하거나 변형된 형태를 인식하는 데 얼마나 효과적인가?
- RQ3수작업으로 설계된 정규표현식이 확장성에 얼마나 제한을 둔다기고, 이는 자동화되거나 학습된 패턴 탐색 기법으로 보완될 수 있는가?
- RQ4성과 이름의 언어적 변형이 인식 성능에 어떤 영향을 미치며, 구조적 디코딩은 오류 전파를 줄일 수 있는가?
주요 결과
- 남편 이름의 문자 오류율(CER)은 96.17%를 기록하여 개인 식별자 인식의 높은 정확도를 보였다.
- 부인 이름의 인식은 CER 98.49%로 대부분의 다른 카테고리보다 뛰어나며, 잘 정제된 항목에서 강력한 성능을 보였다.
- 부인 성(성)의 경우 CER 36.57%로 어려움을 겪었고, 부인의 어머니 이름은 CER 0%로 훈련 데이터에 부족하고 정규표현식에 잘 맞지 않아 모델링이 어려웠다.
- 남편의 어머니 이름과 다른 사람의 상태 정보 역시 저조한 인식 성능(CER 0%)을 보였으며, 이는 훈련 세트에 존재하지 않거나 일관되지 않게 기록된 것으로 보인다.
- 수작업으로 만든 정규표현식에 대한 의존도가 희귀하거나 비정상적인 포맷을 가진 필드의 성능을 저하시키는 주요 한계로 드러났다.
- 이러한 제약에도 불구하고 전체적으로 핵심 필드에 대해 강력한 성능을 보였으며, 최고의 시스템은 총 점수 91.56을 기록하여 단어 수준 기준선에 비해 略로 낮지만 여전히 매우 경쟁력 있는 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.