Skip to main content
QUICK REVIEW

[논문 리뷰] Masked Vision-Language Transformers for Scene Text Recognition

Jie Wu, Ying Peng|arXiv (Cornell University)|2022. 11. 09.
Handwritten Text Recognition Techniques인용 수 5
한 줄 요약

이 논문은 시각적 페치와 마스킹된 텍스트 토큰을 동시에 복원하고, 완전히 마스킹된 입력에서도 학습하는 이중 마스킹 전략을 통해 명시적 및 암시적 언어적 의미를 함께 학습하는 이중 단계의 STR 모델인 Masked Vision-Language Transformers (MVLT)를 제안한다. 비전 트랜스포머 인코더와 다중 모odal 트랜스포머 디코더를 사용하여 다양한 벤치마크에서 최신 기술 성능을 달성하며, CUTE에서 이전 방법보다 최대 2.1% 향상된 성능을 기록한다.

ABSTRACT

Scene text recognition (STR) enables computers to recognize and read the text in various real-world scenes. Recent STR models benefit from taking linguistic information in addition to visual cues into consideration. We propose a novel Masked Vision-Language Transformers (MVLT) to capture both the explicit and the implicit linguistic information. Our encoder is a Vision Transformer, and our decoder is a multi-modal Transformer. MVLT is trained in two stages: in the first stage, we design a STR-tailored pretraining method based on a masking strategy; in the second stage, we fine-tune our model and adopt an iterative correction method to improve the performance. MVLT attains superior results compared to state-of-the-art STR models on several benchmarks. Our code and model are available at https://github.com/onealwj/MVLT.

연구 동기 및 목표

  • 어두운 조명, 가림, 기형 등 어려운 환경에서의 시각적 텍스트 인식(STR) 문제를 해결하기 위해 시각 모델에 언어적 의미를 통합한다.
  • 기존의 언어 인식 STR 모델이 명시적 언어 모델이나 암시적 시각적 신호 중 하나에만 의존하는 한계를 극복한다.
  • 전체적으로 명시적(단어 수준) 및 암시적(맥락적) 언어 지식을 전처리 단계에서 동시에 포괄하는 통합 프레임워크를 개발한다.
  • 전처리 단계에서 레이블이 없는 실제 세계 데이터를 활용하고, 미세조정 단계에서 반복 보정을 적용하여 실제 적용 가능성 향상.

제안 방법

  • 새로운 마스킹 전략을 사용한 이중 단계 학습 파이프라인 제안: (1) 전처리 단계에서 시각적 및 언어적 의미를 학습하기 위한 새로운 마스킹 전략 적용, (2) 반복 보정을 사용한 미세조정.
  • 이미지 패치에서 시각적 특징을 추출하기 위해 비전 트랜스포머(ViT)를 인코더로 사용.
  • 다중 모달 트랜스포머 디코더를 설계하며, 두 개의 서브디코더를 포함: 하나는 문자 수준 토큰을 마스킹하고 예측(명시적 의미), 다른 하나는 전체 텍스트를 마스킹하여 시각적 신호만으로 암시적 의미를 학습.
  • 전처리 단계에서 두 서브디코더 간에 파라미터 공유를 통해 효율성 향상과 특징 정렬 개선.
  • MAE에 영감을 받은 마스킹된 전처리 목표 도입: 시각적 패치와 텍스트 토큰을 마스킹하고 복원하며, 시각적 손실과 텍스트 손실을 함께 최적화.
  • 미세조정 단계에서 반복 보정 적용: 이미지와 이전 예측 결과를 입력으로 사용하여 다중 순차적 순전파를 통해 예측을 개선.

실험 결과

연구 질문

  • RQ1어려운 실제 환경 조건에서 명시적 및 암시적 언어적 의미를 동시에 학습시키는 것이 시각적 텍스트 인식 성능 향상에 기여하는가?
  • RQ2시각적 패치와 텍스트 토큰을 동시에 마스킹하는 이중 마스킹 전략을 사용한 전처리가 모델의 일반화 능력과 강건성 향상에 기여하는가?
  • RQ3레이블이 없는 실제 세계 데이터의 사용이 실생활 시나리오에서 STR 성능 향상에 얼마나 효과적인가?
  • RQ4추론 단계에서 반복 보정을 적용할 경우, 비정상적 또는 열악한 품질의 텍스트에서 정확도 향상이 얼마나 이루어지는가?
  • RQ5완전히 마스킹된 텍스트 입력에서 학습하는 능력(암시적 의미)이 명시적 단어 수준 신호에 의존하는 것보다 더 유익한가?

주요 결과

  • MVLT는 평가된 모든 벤치마크에서 최신 기술 성능을 달성하였으며, SVT, IIIT, IC15, SVTP, CUTE에서 각각 ABINet보다 1.2%, 0.6%, 1.2%, 1.6%, 2.1% 향상된 성능 기록.
  • MVLT*는 전처리 단계에서 레이블이 없는 실제 세계 데이터를 사용하여 추가적인 성능 향상을 기록하였으며, 특히 비정상적인 텍스트에서 강건성 향상이 뚜렷하게 나타났다.
  • 절단 실험 결과, 명시적 및 암시적 의미를 동시에 학습하는 것이 필수적임을 확인: 둘 중 하나를 제거할 경우 정확도가 떨어지며, 암시적 학습이 더 큰 기여를 하였다.
  • 반복 보정은 특히 명시적 텍스트 지도 학습을 사용한 경우 성능 향상에 뚜렷한 기여를 하였다.
  • 전처리 단계에서 모델이 시각적 패치와 마스킹된 텍스트 토큰을 모두 복원할 수 있었으며, 이는 의미 있는 시각-언어 표현을 학습하고 있음을 보여준다.
  • 시각화 결과는 미세조정 후에 모델이 가림, 흐림, 기형, 복잡한 폰트 텍스트를 성공적으로 처리함을 확인하였으며, 강력한 일반화 능력을 지니고 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.