[논문 리뷰] Primitive Representation Learning for Scene Text Recognition
이 논문은 시나리오 텍스트 인식을 위한 프리미티브 표현 학습 네트워크(PREN)와 PREN2D를 제안한다. 특징 맵을 무방향 그래프로 모델링하여 풀링과 가중치가 부여된 집계기법을 통해 안정적이고 내재된 프리미티브 표현을 학습하고, 그래프 컨volution 네트워크를 사용해 시각적 텍스트 표현으로 변환한다. 이 방법은 영어 및 중국어 시나리오 텍스트 벤치마크에서 최신 기술 수준의 성능을 달성하며, PREN2D는 기존의 어텐션 기반 모델 대비 잘못된 정렬을 줄이고 정확도를 향상시킨다.
Scene text recognition is a challenging task due to diverse variations of text instances in natural scene images. Conventional methods based on CNN-RNN-CTC or encoder-decoder with attention mechanism may not fully investigate stable and efficient feature representations for multi-oriented scene texts. In this paper, we propose a primitive representation learning method that aims to exploit intrinsic representations of scene text images. We model elements in feature maps as the nodes of an undirected graph. A pooling aggregator and a weighted aggregator are proposed to learn primitive representations, which are transformed into high-level visual text representations by graph convolutional networks. A Primitive REpresentation learning Network (PREN) is constructed to use the visual text representations for parallel decoding. Furthermore, by integrating visual text representations into an encoder-decoder model with the 2D attention mechanism, we propose a framework called PREN2D to alleviate the misalignment problem in attention-based methods. Experimental results on both English and Chinese scene text recognition tasks demonstrate that PREN keeps a balance between accuracy and efficiency, while PREN2D achieves state-of-the-art performance.
연구 동기 및 목표
- CTC 기반 및 어텐션 기반 시나리오 텍스트 인식 모델의 한계, 특히 CTC의 부족함과 어텐션 메커니즘의 잘못된 정렬 문제를 해결하기 위해.
- 다양한 방향과 비정규적인 텍스트 인스턴스에 대해 강건한 안정적이고 내재된 시각적 표현을 시나리오 텍스트 이미지에서 학습하기 위해.
- 기존 어텐션 기반 모델과의 호환성을 유지하면서도 프리미티브 표현을 통해 병렬 디코딩을 가능하게 하는 프레임워크를 개발하기 위해.
- 2D 어텐션 메커니즘에서의 잘못된 정렬 문제를 해결하기 위해 순수하게 시각적 특징에서 유도된 시각적 텍스트 표현을 통합하기 위해.
제안 방법
- CNN 특징 맵의 요소를 무방향 그래프의 노드로 모델링하여 전역적 특징 집계를 가능하게 한다.
- 다양한 텍스트 인스턴스 간 공통적인 구조적 패턴을 학습하기 위해 공유된 컨볼루션과 전역 평균 풀링을 적용하는 풀링 집계기법을 제안한다.
- 샘플에 특화된 히트맵을 생성하여 특징 맵의 주목할 만한 영역에 적응적으로 집중할 수 있도록 가중치가 부여된 집계기법을 설계한다.
- 학습된 프리미티브 표현을 고수준의 시각적 텍스트 표현으로 변환하기 위해 그래프 컨볼루션 네트워크(GCNs)를 사용한다.
- 시각적 텍스트 표현을 사용하여 병렬 디코딩을 위한 PREN을 구축하고, 이를 2D 어텐션 기반 인코더-디코더 프레임워크에 통합하여 PREN2D를 구성함으로써 정렬을 향상시킨다.
- 6 에포크 동안 합성 데이터로 모델을 훈련하고, 20 에포크 동안 실재 데이터로 미세조정하며, 수평 및 수직 텍스트 서브셋에서 무작위 샘플링을 통한 데이터 증강을 실시한다.
실험 결과
연구 질문
- RQ1전역적 특징 집계에서 유도된 프리미티브 표현이 다각도로 기울어진 텍스트 및 비정규적인 텍스트 이미지에서 시나리오 텍스트 인식의 강건성을 향상시키는가?
- RQ2순수하게 시각적 특징에서 유도된 시각적 텍스트 표현을 사용할 경우 어텐션 기반 시나리오 텍스트 인식에서 잘못된 정렬 문제를 줄일 수 있는가?
- RQ3제안된 프리미티브 표현 학습 프레임워크가 기존의 어텐션 기반 모델에 효과적으로 통합되어 성능을 향상시킬 수 있는가?
- RQ4제안된 방법이 영어 및 중국어 시나리오 텍스트 인식 벤치마크에서 최신 기술 수준의 모델들과 비교해 어떻게 성능을 내는가?
주요 결과
- PREN2D는 다각도로 기울어진 중국어 RCTW 데이터셋에서 85.0%의 최고 수준의 단어 정확도를 달성하여 Baseline2D(84.5%)와 CNN-LSTM-CTC(59.1%)를 모두 능가한다.
- 영어 IIIT5k, SVT, IC03, IC13, IC15, SVTP, CUTE 데이터셋에서 PREN2D는 비교된 모든 모델 중 최고 성능을 기록하며, 다양한 벤치마크에서 강력한 일반화 능력을 입증한다.
- 풀링 집계기법은 동일한 프리미티브 표현에 대해 다양한 입력에서 일관된 특징 맵 반응을 보여주며, 서로 다른 텍스트 인스턴스 간 공통된 구조적 패턴을 학습하고 있음을 보여준다.
- 가중치가 부여된 집계기법은 문자 경계와 중심에 집중하는 적응형 히트맵을 생성하여, 풀링 집계기법 대비 더 나은 특징 국소화 능력을 보인다.
- 어텐션 맵의 시각화 결과, PREN2D는 Baseline2D보다 더 정확한 정렬을 생성하며, 'N'의 중심 영역을 정확히 해당 문자와 연결하지만, Baseline2D는 'N'의 오른쪽 부분을 'I'와 잘못 연결한다.
- PREN은 중국어 데이터셋에서 평균 76.5%의 단어 정확도를 기록하여 CNN-LSTM-CTC(59.1%)를 크게 능가하며, 복잡한 문자 집합을 처리하는 데 있어서 프리미티브 표현 학습의 효과성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.