[논문 리뷰] Verisimilar Image Synthesis for Accurate Detection and Recognition of Texts in Scenes
이 논문은 장면 텍스트 검출 및 인식을 위한 강력한 딥러닝 모델을 훈련시키기 위해 현실적이고 정확하게 애너테이션된 장면 텍스트 이미지를 생성하는 신뢰성 있는 이미지 합성 기법을 제안한다. 의미적 일관성, 시각적 주목성 및 적응형 텍스트 외관 모델을 활용하여, 500만 장의 고품질 이미지를 합성함으로써 여러 벤치마크 데이터셋에서 최신 기술 수준(SOTA) 성능을 크게 향상시킨다.
The requirement of large amounts of annotated images has become one grand challenge while training deep neural network models for various visual detection and recognition tasks. This paper presents a novel image synthesis technique that aims to generate a large amount of annotated scene text images for training accurate and robust scene text detection and recognition models. The proposed technique consists of three innovative designs. First, it realizes "semantic coherent" synthesis by embedding texts at semantically sensible regions within the background image, where the semantic coherence is achieved by leveraging the semantic annotations of objects and image regions that have been created in the prior semantic segmentation research. Second, it exploits visual saliency to determine the embedding locations within each semantic sensible region, which coincides with the fact that texts are often placed around homogeneous regions for better visibility in scenes. Third, it designs an adaptive text appearance model that determines the color and brightness of embedded texts by learning from the feature of real scene text images adaptively. The proposed technique has been evaluated over five public datasets and the experiments show its superior performance in training accurate and robust scene text detection and recognition models.
연구 동기 및 목표
- 장면 텍스트 작업에서 딥 네트워크의 훈련 데이터가 제한되어 발생하는 성능 저하 문제를 해결하기 위해.
- 대규모이고 현실적이며 정확하게 애너테이션된 장면 텍스트 이미지를 생성하여 강력한 검출 및 인식 모델을 훈련시키기 위해.
- 실제 세계의 텍스트 배치 및 외관을 모방하는 이미지를 합성하여 모델의 일반화 능력을 향상시키기 위해.
- 비용이 많이 드는 수동 애너테이션에 의존하는 것을 줄이고, 지능적인 이미지 합성을 통한 데이터 증강을 가능하게 하기 위해.
- 합성 데이터를 사용하여 장면 텍스트 검출 및 인식에서 최신 기술 수준의 성능를 달성하기 위해.
제안 방법
- 기존의 의미적 세그멘테이션 애너테이션을 활용해 의미적으로 일관된 영역에 텍스트를 삽입하여 맥락적 타당성을 확보한다.
- 시각적 주목성 맵을 사용해 의미 영역 내에서 최적의 균일한 영역을 식별하여 텍스트 배치 위치를 선정함으로써 가시성과 현실감을 향상시킨다.
- 로컬 배경 특징에 기반해 텍스트 색상과 밝기를 적응적으로 조정하여 실제 장면 텍스트 통계에서 학습함으로써 시각적 일관성을 향상시킨다.
- 의미 맵과 주목성 맵을 조합하여 배경 이미지에 정확하고 자연스러운 텍스트 삽입 위치를 안내한다.
- 다양한 배경 이미지에 세 구성 요소 프레임워크를 적용하여 500만 장의 합성 장면 텍스트 이미지를 생성한다.
- 실제 데이터에 합성 이미지를 추가하여 검출 및 인식 모델을 훈련하고, 성능 향상을 평가한다.
실험 결과
연구 질문
- RQ1텍스트 배치의 의미적 일관성이 합성된 장면 텍스트 이미지의 현실성과 활용도를 향상시키는가?
- RQ2시각적 주목성을 통합하면 합성 이미지 내에 삽입된 텍스트의 자연스러움과 검출 가능성은 향상되는가?
- RQ3실제 장면 텍스트 특징에서 학습하는 적응형 외관 모델이 합성 텍스트의 시각적 정확도를 향상시키는가?
- RQ4이 방법으로 생성된 합성 데이터가 공개 벤치마크에서 검출 및 인식 성능에 얼마나 기여하는가?
- RQ5기존의 데이터 증강 기법과 비교해 이 방법은 모델 정확도와 일반화 능력 측면에서 어떻게 성능을 내는가?
주요 결과
- 제안된 방법은 장면 텍스트 검출 및 인식을 위한 다섯 개의 공개 벤치마크 데이터셋에서 최신 기술 수준의 성능를 달성했다.
- ICDAR2013 데이터셋에서, 실재 데이터만으로 훈련한 기준 모델의 장면 텍스트 인식 정확도(CRW)는 31.2%에서 500만 장의 합성 이미지를 사용한 경우 87.1%로 상승했다.
- IIIT5K에서는 어휘집 없이 79.3%의 CRW를 기록했고, 1,000개의 어휘집 크기를 사용할 경우 95.3%로 기존 기준을 크게 초월했다.
- SVT에서는 50개의 어휘집 크기를 사용한 합성 데이터로 훈련된 모델이 96.7%의 CRW를 달성하여 강력한 일반화 능력을 입증했다.
- Jaderberg et al. 및 Gupta et al.의 합성 데이터로 훈련된 모델들과 비교해, 모든 데이터셋에서 제안된 합성 데이터를 사용한 모델(CRNN (Real+Ours 5M))이 더 높은 성능를 보였다.
- ICDAR2013에서 50개의 어휘집 크기를 사용한 결과, 이전 최신 기술 수준 모델들이 800만 장의 합성 이미지를 사용한 것보다도 높은 98.1%의 인식 정확도를 기록했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.