[논문 리뷰] Separating Content from Style Using Adversarial Learning for Recognizing Text in the Wild
이 논문은 복잡한 배경을 가진 시나리오 이미지에서 텍스트 내용을 분리하여 텍스트 인식 정확도를 향상시키기 위해 새로운 적대적 학습 프레임워크를 제안한다. 주어진 인식기의 주의 기반 특징 추출과 문자 수준의 적대적 훈련 및 피드백 메커니즘을 갖춘 생성 적대적 네트워크를 활용함으로써, 픽셀 수준의 애너테이션이나 쌍화된 데이터가 없이도 단지 비쌍화된 이미지와 텍스트 레이블만을 사용하여 최신 기술 수준(SOTA)의 성능을 달성하며, 인식 난이도를 크게 감소시킨다.
We propose to improve text recognition from a new perspective by separating the text content from complex backgrounds. As vanilla GANs are not sufficiently robust to generate sequence-like characters in natural images, we propose an adversarial learning framework for the generation and recognition of multiple characters in an image. The proposed framework consists of an attention-based recognizer and a generative adversarial architecture. Furthermore, to tackle the issue of lacking paired training samples, we design an interactive joint training scheme, which shares attention masks from the recognizer to the discriminator, and enables the discriminator to extract the features of each character for further adversarial training. Benefiting from the character-level adversarial training, our framework requires only unpaired simple data for style supervision. Each target style sample containing only one randomly chosen character can be simply synthesized online during the training. This is significant as the training does not require costly paired samples or character-level annotations. Thus, only the input images and corresponding text labels are needed. In addition to the style normalization of the backgrounds, we refine character patterns to ease the recognition task. A feedback mechanism is proposed to bridge the gap between the discriminator and the recognizer. Therefore, the discriminator can guide the generator according to the confusion of the recognizer, so that the generated patterns are clearer for recognition. Experiments on various benchmarks, including both regular and irregular text, demonstrate that our method significantly reduces the difficulty of recognition. Our framework can be integrated into recent recognition methods to achieve new state-of-the-art recognition accuracy.
연구 동기 및 목표
- 복잡한 배경, 다양한 형태, 폰트 변형으로 인해 발생하는 시나리오 텍스트 인식 난이도를 줄이기 위해.
- 텍스트 이미지 생성에서 이미지 간 번역을 위한 쌍화된 훈련 데이터 부족 문제를 해결하기 위해.
- 배경 스타일을 정규화하면서도 문자 수준에서 텍스트 내용을 유지함으로써 인식 정확도를 향상시키기 위해.
- 피크셀 수준의 애너테이션이나 쌍화된 데이터 없이도 입력 이미지와 해당 텍스트 레이블만을 사용하여 엔드 투 엔드 훈련을 가능하게 하기 위해.
- 판별자와 인식기 사이의 피드백 메커니즘을 개발하여 인식 혼동을 통해 생성 품질을 향상시키기 위해.
제안 방법
- 프레임워크는 주의 기반 인식기를 활용하여 문자 수준의 특징을 추출하고 적대적 훈련을 이끌어낸다.
- 생성 적대적 네트워크(GAN)는 비쌍화된 실제 이미지와 텍스트 레이블만을 사용하여 복잡한 배경을 제거하면서도 텍스트 내용을 유지하도록 훈련된다.
- 인식기에서 유도된 주의 마스크를 판별자로 공유하는 상호작용적 공동 훈련 기법을 통해 문자 수준의 감독을 실현한다.
- 판별자는 인식기의 혼동을 기반으로 유도되어 생성된 이미지가 더 선명하고 인식 가능성이 높은 문자 패턴을 생성하도록 개선된다.
- 훈련 중에 임의의 문자를 선택하여 온라인으로 타겟 스타일 샘플을 합성함으로써 대규모 쌍화된 데이터가 필요 없어진다.
- 판별자와 인식기 사이의 피드백 메커니즘이 구축되어 생성기가 인식 오류에 더 강건한 이미지를 생성할 수 있도록 한다.
실험 결과
연구 질문
- RQ1쌍화된 훈련 데이터가 없이도 적대적 학습이 시나리오 이미지의 복잡한 배경에서 텍스트 내용을 효과적으로 분리하는 데에 적합한가?
- RQ2문자 수준의 적대적 감독은 전반적인 거시적이고 군집된 GAN과 비교해 생성된 텍스트 이미지의 정밀도를 어떻게 향상시킬 수 있는가?
- RQ3판별자와 인식기 사이의 피드백 메커니즘이 생성된 텍스트 패턴의 선명도와 인식 가능성에 어떻게 기여하는가?
- RQ4배경 스타일 정규화가 실제 세계 벤치마크에서 인식 정확도 향상에 어느 정도 기여하는가?
- RQ5제안된 방법은 존재하는 인식 프레임워크에 통합되어 최소한의 수정으로 최신 기술 수준의 성능을 달성할 수 있는가?
주요 결과
- 제안된 방법은 SVT-P 데이터셋에서 6.0% 상대적 향상으로 여러 벤치마크에서 새로운 최신 기술 수준의 인식 정확도를 달성한다.
- 합성 데이터로만 훈련된 경우조차도 실제 데이터로 훈련된 베이스라인을 능가함으로써 배경 스타일 정규화의 효과를 입증한다.
- 실제 데이터(50,000개 샘플)와 합성 데이터를 통합함으로써 성능이 더욱 향상되며, 이는 방법의 일반화 능력과 도메인 갭 감소 효과를 시사한다.
- 온라인으로 합성된 타겟 스타일 샘플(단일 문자)의 사용은 대규모 쌍화된 데이터셋이 없이도 효과적인 훈련이 가능함을 보여준다.
- 판별자와 인식기 사이의 피드백 메커니즘은 더 선명한 문자 패턴을 만들어내어 인식 혼동을 줄이고 강건성을 향상시킨다.
- 실험 결과, RGB 영역에서의 생성이 회색조보다 성능이 떨어지지 않음을 확인하여 핵심 과제는 색상 표현이 아니라 미세한 감독에 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.