Skip to main content
QUICK REVIEW

[논문 리뷰] End-to-end Handwritten Paragraph Text Recognition Using a Vertical Attention Network

Denis Coquenet, Clément Chatelain|arXiv (Cornell University)|2020. 12. 07.
Handwritten Text Recognition Techniques인용 수 9
한 줄 요약

이 논문은 수직 주의망(VAN)을 사용한 종단간(end-to-end), 세그먼테이션 없는 수기 단락 인식 모델을 제안한다. 이 모델은 콘텐츠 기반 및 위치 기반의 하이브리드 주의 메커니즘을 활용하여 선을 암묵적으로 세그먼테이션하고 순차적으로 텍스트를 디코딩한다. 이 방법은 RIMES에서 1.91%, IAM에서 4.45%, READ 2016에서 3.59%의 최신 기술 수준(SOTA) 문자 오류율을 달성하여 명시적 선 세그먼테이션 또는 다단계 학습 없이도 뛰어난 성능을 보였다.

ABSTRACT

Unconstrained handwritten text recognition remains challenging for computer vision systems. Paragraph text recognition is traditionally achieved by two models: the first one for line segmentation and the second one for text line recognition. We propose a unified end-to-end model using hybrid attention to tackle this task. This model is designed to iteratively process a paragraph image line by line. It can be split into three modules. An encoder generates feature maps from the whole paragraph image. Then, an attention module recurrently generates a vertical weighted mask enabling to focus on the current text line features. This way, it performs a kind of implicit line segmentation. For each text line features, a decoder module recognizes the character sequence associated, leading to the recognition of a whole paragraph. We achieve state-of-the-art character error rate at paragraph level on three popular datasets: 1.91% for RIMES, 4.45% for IAM and 3.59% for READ 2016. Our code and trained model weights are available at https://github.com/FactoDeepLearning/VerticalAttentionOCR.

연구 동기 및 목표

  • 명시적 선 세그먼테이션에 의존하고 오류 누적이 발생하는 전통적인 이중 단계 수기 단락 인식 시스템의 한계를 해결하기 위해.
  • 학습 시 비용이 많이 들고 수작업으로 레이블링된 선 수준 세그먼테이션 레이블이 필요 없도록 하기 위해.
  • 주의 메커니즘을 활용하여 선 세그먼테이션과 텍스트 인식을 하나의 종단간 학습 가능한 모델로 통합하기 위해.
  • 반복 주의 메커니즘을 통해 독서 순서와 텍스트 선의 위치를 암묵적으로 학습하기 위해.
  • 전체 단락 수준의 추론을 유지하면서도 선 이미지에서의 사전 학습을 통해 정확도 향상과 수렴성 향상을 도모하기 위해.

제안 방법

  • 전체 단락 이미지에서 공간적 정보와 문자 수준의 정보를 유지하면서 2D 특징 맵을 추출하기 위해 완전 컨volution 네트워크 기반의 인코더를 사용한다.
  • 하이브리드 주의 메커니즘이 수직 가중 마스크를 생성하여 특정 특징의 행에 집중함으로써 암묵적인 선 위치 특정 및 세그먼테이션을 가능하게 한다.
  • 주의 메커니즘은 반복적이다. 독서 순서에 따라 하나의 텍스트 선씩 처리하며, 콘텐츠 정보와 위치 정보를 모두 사용한다.
  • 디코더는 순환 신경망으로 구현되어 각 주의를 받은 선 표현에서 문자 시퀀스를 변환한다.
  • 학습 중에 예측 시퀀스를 정답 전사와 정렬하기 위해 커넥티스트릭 타임클래시피케이션(CTC) 손실을 사용한다.
  • 전체 단락 데이터에서의 피니어튜닝 이전에 선 이미지에서의 사전 학습을 통해 수렴성과 최종 인식 정확도를 향상시킨다.

실험 결과

연구 질문

  • RQ1명시적 세그먼테이션 감독 없이도 단일 신경망이 암묵적인 선 세그먼테이션과 텍스트 인식을 효과적으로 동시에 수행할 수 있는가?
  • RQ2콘텐츠 정보와 위치 정보를 통합한 하이브리드 주의 메커니즘이 표준 주의 메커니즘보다 단락 수준의 인식 성능을 어떻게 향상시키는가?
  • RQ3선 이미지에서의 사전 학습이 종단간 단락 인식 모델의 성능에 얼마나 기여하는가?
  • RQ4종단간, 세그먼테이션 없는 접근 방식이 정확도와 강건성 측면에서 기존의 이중 단계 시스템을 능가할 수 있는가?
  • RQ5명시적 레이아웃 모델링 없이도 다양한 레이아웃 변형(예: 변동하는 줄 간격, 기울기 등)에 대해 모델이 얼마나 잘 일반화되는가?

주요 결과

  • 제안된 수직 주의망(VAN)은 RIMES 데이터셋에서 최신 기술 수준의 문자 오류율 1.91%를 달성하여 이전 방법들을 능가했다.
  • IAM 데이터셋에서 모델은 문자 오류율 4.45%를 기록하여 다양한 수기 스타일에 대한 강력한 일반화 능력을 보였다.
  • READ 2016 데이터셋에서 모델은 문자 오류율 3.59%를 달성하여 도전적인 실생활 단락 이미지에 대한 효과성을 확인했다.
  • 별도의 선 세그먼테이션 및 인식 단계를 제거함으로써 오류 누적 현상을 크게 줄였다.
  • 선 이미지에서의 사전 학습이 수렴성과 최종 인식 정확도 향상에 기여하여 모델의 뛰어난 성능에 기여했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.