Skip to main content
QUICK REVIEW

[논문 리뷰] CLIP4STR: A Simple Baseline for Scene Text Recognition with Pre-trained Vision-Language Model

Shuai Zhao, Ruijie Quan|arXiv (Cornell University)|2023. 05. 23.
Multimodal Machine Learning Applications참고 문헌 98인용 수 6
한 줄 요약

CLIP4STR는 강력한 백본으로서 CLIP의 사전 훈련된 시각-언어 모델을 활용하는 단순하면서도 효과적인 시나리오 텍스트 인식(STR) 프레임워크를 제안한다. 이는 초기 예측을 위한 시각 브랜치와 주어진 시각적 특징과 텍스트 의미 간의 어텐션을 통해 의미적 보정을 수행하는 교차모달 브랜치를 갖춘 이중 브랜치 아키텍처를 사용하여, 불규칙한 텍스트 시나리오를 포함한 11개의 STR 벤치마크에서 최신 기술 성능을 달성한다.

ABSTRACT

Pre-trained vision-language models~(VLMs) are the de-facto foundation models for various downstream tasks. However, scene text recognition methods still prefer backbones pre-trained on a single modality, namely, the visual modality, despite the potential of VLMs to serve as powerful scene text readers. For example, CLIP can robustly identify regular (horizontal) and irregular (rotated, curved, blurred, or occluded) text in images. With such merits, we transform CLIP into a scene text reader and introduce CLIP4STR, a simple yet effective STR method built upon image and text encoders of CLIP. It has two encoder-decoder branches: a visual branch and a cross-modal branch. The visual branch provides an initial prediction based on the visual feature, and the cross-modal branch refines this prediction by addressing the discrepancy between the visual feature and text semantics. To fully leverage the capabilities of both branches, we design a dual predict-and-refine decoding scheme for inference. We scale CLIP4STR in terms of the model size, pre-training data, and training data, achieving state-of-the-art performance on 13 STR benchmarks. Additionally, a comprehensive empirical study is provided to enhance the understanding of the adaptation of CLIP to STR. Our method establishes a simple yet strong baseline for future STR research with VLMs.

연구 동기 및 목표

  • 단일 모odal 사전 훈련에 의존하는 분야임에도 불구하고, CLIP이라는 사전 훈련된 시각-언어 모델이 시나리오 텍스트 인식(STR)의 강력한 백본으로 기능할 수 있는지 조사하는 것.
  • 복잡하고 불규칙한 장면에서 텍스트 인식 능력이 뛰어난 시각-언어 모델(VLM)이 STR 연구에서 아직 충분히 활용되지 않고 있는 점을 보완하는 것.
  • 특히 기울기, 곡선, 흐림, 가림 등의 어려운 텍스트 변형에 대해 시각-언어 사전 훈련을 활용한 단순하면서도 강력한 기준 모델을 향후 STR 연구를 위한 기초로 설정하는 것.
  • CLIP가 STR에 어떻게 적응하는지 실증적으로 연구하고, 불규칙한 텍스트에서 뛰어난 성능을 내는 데 배경이 되는 메커니즘을 이해하는 것.

제안 방법

  • CLIP4STR는 이중 인코더-디코더 아키텍처를 사용한다: 시각 브랜치는 CLIP의 이미지 및 텍스트 인코더를 활용해 초도 예측을 수행하고, 교차모달 브랜치는 시각적 특징과 텍스트 의미 간의 정렬을 통해 예측을 보정한다.
  • 시각 브랜치는 이미지 인코더와 순서가 뒤섞인 시퀀스 모델링을 사용하는 트랜스포머 디코더를 활용해 임의의 순서에서 문자 간 의존성을 모델링함으로써 초도 예측을 생성한다.
  • 교차모달 브랜치는 시각적 특징과 텍스트 임베딩 간의 교차 어텐션을 사용하여, 시각적 모호성으로 인한 오류를 수정하는 의미 인식 기반 철자 검사기 역할을 한다.
  • 추론을 위해 이중 예측-보정 디코딩 전략을 설계하였다: 시각 브랜치가 첫 번째 예측을 제공하고, 이는 이후 맥락 인식 기반 디코딩 전략을 사용해 교차모달 브랜치에 의해 반복적으로 보정된다.
  • 추론 과정에서 식 (9)는 반복적인 교차모달 디코딩을 직접적인 맥락 주입으로 대체하여 계산량을 줄이고 정확도 하락을 최소화한다.
  • 시각-언어 정렬 헤드를 미세조정하지 않고 CLIP의 사전 훈련된 이미지 및 텍스트 인코더를 그대로 활용함으로써 모델의 제로샷 일반화 능력을 유지한다.

실험 결과

연구 질문

  • RQ1CLIP는 이미지-텍스트 쌍으로 사전 훈련되었지만, 미세조정 없이도 시나리오 텍스트 인식에 효과적인 백본으로 기능할 수 있는가?
  • RQ2단일 모달 모델과 비교해 CLIP의 시각-언어 사전 훈련이 기울기, 곡선, 흐림, 가림 등의 불규칙한 텍스트를 어떻게 잘 인식할 수 있는가?
  • RQ3교차모달 브랜치가 예측 보정에 기여하는 정도는 어떻게 되며, 시각적 모호성을 다룰 때 시각 브랜치와 비교해 어떤 차이가 있는가?
  • RQ4더 큰 CLIP 버전(예: ViT-L)을 사용하거나 여러 보정 반복을 적용할 경우, 추론 속도와 정확도 사이의 상충 관계는 어떻게 되는가?
  • RQ5수정된 애너테이션을 가진 정제된 벤치마크에서 CLIP4STR의 성능은 어떠하며, 데이터 보정 후에도 최신 기술 성능을 유지하는가?

주요 결과

  • CLIP4STR는 IC15, SVTP, CUTE, HOST 등 11개의 STR 벤치마크에서 최신 기술 성능을 달성했으며, 표준 평가 조건에서 IC15에서 94.1%의 정확도와 CUTE에서 99.3%의 정확도를 기록했다.
  • 교차모달 브랜치는 단독으로 시각 브랜치를 사용할 경우보다 최대 1.1%의 정확도 향상을 이끌어내어, 시각적 모호성과 의미 불일치를 보정하는 데 효과적임을 입증했다.
  • ViT-L을 백본으로 사용하면 9개 벤치마크 평균 정확도가 91.9%로 상승하지만(A100 GPU 기준 6.52ms/샘플의 추론 시간 소요), 성능 향상에 비해 계산 비용이 증가한다.
  • 한 번의 보정 반복을 포함한 이중 디코딩 전략이 최적의 성능-속도 균형을 이룬다. 이보다 더 많은 반복을 수행해도 정확도 향상이 없다.
  • 정제된 벤치마크에서 CLIP4STR는 여전히 최신 기술 성능을 유지하며, IIIT5K에서 99.4%, CUTE에서 99.0%의 정확도를 기록하여 지표 수정 후에도 강건함을 입증했다.
  • 클로즈 펠링 디코딩 변형은 ViT-B 기준 3.41ms의 추론 시간으로 단축하면서도 높은 정확도를 유지하여 실시간 응용 분야에서의 실용성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.