Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Granularity Prediction with Learnable Fusion for Scene Text Recognition

Cheng Da, Peng Wang|arXiv (Cornell University)|2023. 07. 25.
Handwritten Text Recognition Techniques인용 수 4
한 줄 요약

이 논문은 별도의 언어 모델 없이도 성능을 향상시키기 위해 다중 분해능 예측(문자, BPE, WordPiece 서브워드 표현 통합)을 통한 시각 트랜스포머 기반의 장면 텍스트 인식 모델인 MGP-STR을 제안한다. 유사도 기반의 학습 가능한 융합 전략(LFS)을 도입하여 예측된 텍스트와 이미지 특징 간의 다중 모odal 유사도를 측정함으로써 IIIT-5K, ICDAR 2015, SVT, CUTE 등의 표준 벤치마크에서 최신 기술 수준의 정확도 94%를 달성한다.

ABSTRACT

Due to the enormous technical challenges and wide range of applications, scene text recognition (STR) has been an active research topic in computer vision for years. To tackle this tough problem, numerous innovative methods have been successively proposed, and incorporating linguistic knowledge into STR models has recently become a prominent trend. In this work, we first draw inspiration from the recent progress in Vision Transformer (ViT) to construct a conceptually simple yet functionally powerful vision STR model, which is built upon ViT and a tailored Adaptive Addressing and Aggregation (A$^3$) module. It already outperforms most previous state-of-the-art models for scene text recognition, including both pure vision models and language-augmented methods. To integrate linguistic knowledge, we further propose a Multi-Granularity Prediction strategy to inject information from the language modality into the model in an implicit way, \ie, subword representations (BPE and WordPiece) widely used in NLP are introduced into the output space, in addition to the conventional character level representation, while no independent language model (LM) is adopted. To produce the final recognition results, two strategies for effectively fusing the multi-granularity predictions are devised. The resultant algorithm (termed MGP-STR) is able to push the performance envelope of STR to an even higher level. Specifically, MGP-STR achieves an average recognition accuracy of $94\%$ on standard benchmarks for scene text recognition. Moreover, it also achieves state-of-the-art results on widely-used handwritten benchmarks as well as more challenging scene text datasets, demonstrating the generality of the proposed MGP-STR algorithm. The source code and models will be available at: \url{https://github.com/AlibabaResearch/AdvancedLiterateMachinery/tree/main/OCR/MGP-STR}.

연구 동기 및 목표

  • 분리된 언어 모델에 의존하지 않고 암묵적으로 언어 지식을 통합함으로써 장면 텍스트 인식(STR) 성능을 향상시키는 것.
  • 단일 문자 수준 예측의 한계를 보완하기 위해 노이즈 및 변형에 더 강건한 성능을 내기 위해 BPE 및 WordPiece 서브워드 표현을 도입함으로써 성능 향상에 기여하는 것.
  • 이미지-텍스트 유사도 기반으로 동적으로 다중 분해능 예측을 융합하는 학습 가능한 융합 메커니즘을 설계하여 최종 인식 정확도를 향상시키는 것.
  • 시각 트랜스포머 기반의 순수 시각 STR 모델과 적응형 어텐션 모듈(A3)을 개발하여 기존의 순수 시각 및 언어 보강 방법을 초월하는 성능을 달성하는 것.
  • 반복적 개선 없이도 빠른 추론을 가능하게 하면서도 다양한 벤치마크에서 최신 기술 수준의 성능을 달성하는 것, 특히 실제 도메인 및 수기 텍스트 데이터셋을 포함한 다양한 환경에서의 일반화 능력을 확보하는 것.

제안 방법

  • 시각 트랜스포머(ViT) 기반의 순수 시각 STR 모델을 구축하고, 개선된 특징 표현을 위해 특화된 적응형 어드레싱 및 집계(A3) 모듈을 통합한다.
  • 출력 공간을 확장하여 문자 수준, BPE 수준, WordPiece 수준의 예측을 포함하는 다중 분해능 예측(MGP)을 도입함으로써 외부 언어 모델 없이도 다중 작업 학습을 가능하게 한다.
  • 각 브랜치의 신뢰도 점수를 활용하여 예측을 융합하는 신뢰도 기반 융합 전략(CFS)을 적용하여 단순하면서도 효과적인 융합 메커니즘을 제공한다.
  • 예측된 텍스트와 이미지 특징 간의 다중 모달 유사도를 계산하기 위해 학습 가능한 모듈을 사용하는 학습 가능한 융합 전략(LFS)을 제안하며, CLIP와 유사한 아이디어를 기반으로 하여 동적이고 맥락 인식 가능한 융합을 가능하게 한다.
  • 문자, BPE, WordPiece 예측에 대해 각각 별도의 손실 함수를 사용하여 엔드 투 엔드로 모델을 훈련함으로써 언어적 우선 지식이 다중 작업 최적화 과정을 통해 암묵적으로 학습되도록 한다.
  • 이미지 A3 모듈을 활용하여 희소하고 어텐션 기반의 특징 맵을 생성함으로써 주목할 만한 텍스트 영역을 강조하며, LFS에서 이미지-텍스트 매칭을 위한 글로벌 풀링 메커니즘으로서의 기능을 수행한다.

실험 결과

연구 질문

  • RQ1BPE 및 WordPiece와 같은 서브워드 표현을 통합한 다중 분해능 예측이 암묵적인 언어 모델 없이도 장면 텍스트 인식 성능을 향상시킬 수 있는가?
  • RQ2이미지-텍스트 유사도 기반의 학습 가능한 융합 전략이 신뢰도 기반 융합 전략보다 정확도와 강건성 측면에서 어떻게 비교되는가?
  • RQ3제안된 MGP-STR 모델이 표준, 수기, 어려운 실제 도메인 장면 텍스트 데이터셋을 포함한 다양한 벤치마크에서 얼마나 잘 일반화되는가?
  • RQ4MGP-STR에서 반복적 개선 기법을 사용하지 않음으로써 기존 방법 대비 더 빠른 추론을 달성하면서도 최신 기술 수준의 정확도를 유지할 수 있는가?
  • RQ5다중 분해능 예측을 통해 언어의 조합적 특성을 활용함으로써 모델 성능을 추가로 향상시킬 수 있는가?

주요 결과

  • 학습 가능한 융합 전략(LFS)을 적용한 MGP-STR는 IIIT-5K, ICDAR 2015, SVT, CUTE 등의 표준 장면 텍스트 벤치마크에서 평균 정확도 94%의 최신 기술 수준 성능을 달성한다.
  • 암묵적인 언어 지식 통합의 효과를 입증하기 위해 별도의 언어 모델 없이도 순수 시각 및 언어 보강 기반 STR 방법을 모두 초월하는 성능을 기록한다.
  • 학습 가능한 융합 전략(LFS)은 신뢰도 기반 융합(CFS)보다 성능 향상이 뚜렷하게 높아, 유사도 기반 융합이 예측된 텍스트와 시각적 특징 간의 일치를 더 잘 달성함을 시사한다.
  • 수기 텍스트 벤치마크(IAM, CVL, RIMES)에서도 MGP-STR는 최신 기술 수준의 성능을 기록하여, 서체나 저품질 텍스트에 대한 강건한 일반화 능력을 입증한다.
  • 어려운 데이터셋인 ArT, COCO-Text, Uber-Text에서도 SOTA 성능을 달성하여, 복잡한 실제 도메인 환경에서의 강건성을 확인한다.
  • 이미지 A3 모듈에서 생성된 어텐션 맵은 희소하지만 관련 텍스트 영역에 집중되어 있어, 이 모듈이 LFS에서 이미지-텍스트 매칭을 위한 효과적인 글로벌 풀링 메커니즘으로 작용함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.