Skip to main content
QUICK REVIEW

[논문 리뷰] Read Like Humans: Autonomous, Bidirectional and Iterative Language Modeling for Scene Text Recognition

Shancheng Fang, Hongtao Xie|arXiv (Cornell University)|2021. 03. 11.
Handwritten Text Recognition Techniques참고 문헌 48인용 수 21
한 줄 요약

ABINet는 시각과 언어 모델링을 명시적으로 분리하고, 맥락 인식 텍스트 예측을 위한 새로운 이중 방향 클로즈 네트워크(BCN)를 사용하며, 반복 보정을 통해 예측을 정밀하게 다듬는 자율적이고 이중 방향적이며 반복적인 언어 모델링 프레임워크를 제안한다. 이는 특히 저품질 이미지에서 최신 기술 수준의 성능을 달성하며, 비라벨 데이터를 활용한 앙상블 자기학습을 통해 인간 수준의 인식을 가능하게 한다.

ABSTRACT

Linguistic knowledge is of great benefit to scene text recognition. However, how to effectively model linguistic rules in end-to-end deep networks remains a research challenge. In this paper, we argue that the limited capacity of language models comes from: 1) implicitly language modeling; 2) unidirectional feature representation; and 3) language model with noise input. Correspondingly, we propose an autonomous, bidirectional and iterative ABINet for scene text recognition. Firstly, the autonomous suggests to block gradient flow between vision and language models to enforce explicitly language modeling. Secondly, a novel bidirectional cloze network (BCN) as the language model is proposed based on bidirectional feature representation. Thirdly, we propose an execution manner of iterative correction for language model which can effectively alleviate the impact of noise input. Additionally, based on the ensemble of iterative predictions, we propose a self-training method which can learn from unlabeled images effectively. Extensive experiments indicate that ABINet has superiority on low-quality images and achieves state-of-the-art results on several mainstream benchmarks. Besides, the ABINet trained with ensemble self-training shows promising improvement in realizing human-level recognition. Code is available at https://github.com/FangShancheng/ABINet.

연구 동기 및 목표

  • 엔드 투 엔드 시나리오 텍스트 인식 시스템에서 언어 지식을 효과적으로 모델링하는 데 도전한다.
  • 현재 언어 모델의 한계, 즉 암묵적 학습, 단방향 특징 표현 및 노이즈가 많은 시각 입력에 대한 민감성 문제를 해결한다.
  • 흐린 이미지, 노이즈, 비정상적인 텍스트와 같은 도전적인 조건에서도 이중 방향 맥락과 반복 정밀 조정을 통해 더 견고한 인식을 가능하게 한다.
  • 비라벨 데이터를 활용한 자기학습을 통한 준지도 학습을 탐색하여 일반화 능력을 향상시키고 인간 수준의 성능에 접근한다.

제안 방법

  • ABINet는 시각과 언어 모델링 간의 기울기 흐름을 차단함으로써 두 모델을 분리하여 언어 규칙의 명시적이고 독립적인 학습을 강제한다.
  • 좌우 맥락을 동시에 고려하는 새로운 이중 방향 클로즈 네트워크(BCN)를 설계하여, 마스크된 어텐션을 사용해 단계 간의 정보 泄漏를 방지한다.
  • 추론 중에 반복 보정을 적용하여 예측 결과를 반복적으로 언어 모델에 다시 입력함으로써 결과를 정밀하게 다듬고 길이 불일치 문제를 완화한다.
  • 앙상블 자기학습 방법을 제안하여, 비라벨 이미지에서의 반복 예측 결과를 의사 레이블로 활용해 언어 모델을 향상시킨다.
  • 프레임워크는 시각 모델과 언어 모델을 별도로 사전 학습할 수 있도록 지원하여 전이 학습과 더 높은 견고성 향상을 가능하게 한다.
  • Transformer 기반 아키텍처를 사용하여 주의 깊은 마스킹과 반복 추론을 통해 맥락 인식 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1엔드 투 엔드 결합 모델과 비교해 명시적이고 자율적인 언어 모델링이 시나리오 텍스트 인식 성능을 향상시키는가?
  • RQ2클로즈 스타일 네트워크를 활용한 이중 방향 맥락 모델링은 특히 모호하거나 손상된 텍스트에서 정확도에 어떤 영향을 미치는가?
  • RQ3반복 보정이 오류 전파를 어느 정도 감소시키며, 저품질 이미지에서의 견고성을 향상시키는가?
  • RQ4비라벨 데이터를 활용한 앙상블 자기학습이 모델의 일반화 능력을 크게 향상시키고 인간 수준의 성능에 도달하는 데 기여하는가?

주요 결과

  • ABINet-SV는 재현된 SOTA SRN-SV보다 IC13, SVT, IIIT, IC15, SVTP, CUTE에서 각각 0.5%, 2.3%, 0.4%, 1.4%, 0.6%, 1.4% 향상된 성능을 기록했다.
  • ABINet-LV는 IC13, SVT, IC15, SVTP, CUTE 벤치마크에서 각각 0.6%, 1.2%, 1.8%, 1.4%, 1.0% 향상된 성능을 기록했다.
  • 시각적 특징가 신뢰할 수 없는 저품질 이미지가 포함된 데이터셋(예: SVT, SVTP, IC15)에서 뚜렷한 우수성을 보였다.
  • 반복 보정은 오류 전파를 감소시키고, 흐린 이미지나 비정상적인 텍스트와 같은 어려운 예제의 정확한 인식을 가능하게 하였다. 이는 정성적 결과에서 확인되었다.
  • 앙상블 자기학습 방법(ABINet-LV est)은 데이터 활용도를 향상시키고 모든 벤치마크에서 안정적인 성능 향상을 달성했다.
  • 모델는 세 번의 반복 이후 성능 포화 상태에 도달함을 확인하여, 더 깊은 반복은 불필요하고 계산적으로 비효율적임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.