Skip to main content
QUICK REVIEW

[논문 리뷰] GA-DAN: Geometry-Aware Domain Adaptation Network for Scene Text Detection and Recognition

Fangneng Zhan, Chuhui Xue|arXiv (Cornell University)|2019. 07. 23.
Handwritten Text Recognition Techniques참고 문헌 74인용 수 5
한 줄 요약

이 논문은 시나리오 텍스트 검출 및 인식을 위한 기하학적 주의 도메인 적응 네트워크(GA-DAN)를 제안한다. GA-DAN은 기하학적 공간과 외관 공간 양쪽에서 동시에 도메인 이탈을 모델링하며, 다중 모odal 공간 학습과 분리된 사이클 일致성 손실을 활용하여 도메인 간 고해상도의 적응된 이미지를 생성한다. 이로 인해 SVTP에서 51.7%의 정확도와 CUTE에서 43.1%의 정확도를 기록하며, 시나리오 텍스트 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Recent adversarial learning research has achieved very impressive progress for modelling cross-domain data shifts in appearance space but its counterpart in modelling cross-domain shifts in geometry space lags far behind. This paper presents an innovative Geometry-Aware Domain Adaptation Network (GA-DAN) that is capable of modelling cross-domain shifts concurrently in both geometry space and appearance space and realistically converting images across domains with very different characteristics. In the proposed GA-DAN, a novel multi-modal spatial learning technique is designed which converts a source-domain image into multiple images of different spatial views as in the target domain. A new disentangled cycle-consistency loss is introduced which balances the cycle consistency in appearance and geometry spaces and improves the learning of the whole network greatly. The proposed GA-DAN has been evaluated for the classic scene text detection and recognition tasks, and experiments show that the domain-adapted images achieve superior scene text detection and recognition performance while applied to network training.

연구 동기 및 목표

  • 기존 비지도 도메인 적응 방법에서 기하학적 공간과 외관 공간 양쪽에서의 동시에 도메인 이탈 모델링 부족 문제를 해결한다.
  • 원천 도메인과 타겟 도메인이 기하학적 왜곡(예: 투시, 흐림)에서 크게 다를 경우 시나리오 텍스트 작업의 성능 저하 문제를 해결한다.
  • 원천 도메인의 시나리오 텍스트 이미지를 타겟 도메인의 다양한 시야로 현실적으로 변환하면서 의미적 및 구조적 일관성을 유지하는 방법을 개발한다.
  • 다양한 도메인 적응된 이미지를 생성함으로써 타겟 도메인의 특성을 더 잘 반영하는 방식으로 학습 일반화를 향상시킨다.
  • 기하학적 공간과 외관 공간 양쪽에서의 적응 균형을 확보하고 학습 안정성 및 성능을 향상시키기 위해 분리된 사이클 일치성 손실을 도입한다.

제안 방법

  • 원천 이미지에 여러 가지 공간 변환(예: 투시, 애피니티)을 적용하여 다양한 타겟 유사 시야를 생성하는 다중 모달 공간 학습 메커니즘을 제안한다.
  • 실제와 가짜 공간 변환을 구분하는 공간 변환 판별자를 도입하여 기하학적 공간에서의 적대적 학습을 가능하게 한다.
  • 외관 공간과 기하학적 공간 양쪽에서 별도로 일致성을 강제하는 분리된 사이클 일치성 손실을 설계하여 두 도메인 간 간섭을 방지한다.
  • 두 개의 생성자(G_X와 G_Y)와 두 개의 판별자(D_X와 D_Y)를 갖는 사이클-GAN 유사 프레임워크를 활용하며, G_X는 원천 도메인에서 타겟 도메인으로 매핑하고 G_Y는 반대 방향으로 매핑한다.
  • 특히 곡선 및 투시 왜곡을 다룰 때 효과적인 유연한 공간 변환 모델링을 위해 투명판 스플라인(TPS)을 사용한다.
  • 다양한 공간 시야에서 유도된 적응된 이미지를 후속 시나리오 텍스트 검출 및 인식 모델의 학습 데이터로 활용하여 일반화 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1기하학적 공간과 외관 공간 양쪽에서 동시에 적응하는 것이 도메인 이탈 상황에서 시나리오 텍스트 검출 및 인식 성능을 크게 향상시킬 수 있는가?
  • RQ2원천 이미지당 여러 개의 타겟 유사 시야를 생성하는 다중 모달 공간 학습이 단일 시야 적응보다 더 나은 일반화 성능을 이끌 수 있는가?
  • RQ3분리된 사이클 일치성 손실이 기하학적 공간과 외관 공간 양쪽에서 학습의 균형과 안정성을 효과적으로 확보할 수 있는가?
  • RQ4GA-DAN은 CycleGAN, CyCADA, SimGAN과 같은 최신 기술 수준의 도메인 적응 방법과 비교해 시나리오 텍스트 데이터의 기하학적 불일치를 어떻게 다루는가?
  • RQ5GA-DAN를 사용한 도메인 적응이 CUTE와 SVTP와 같은 소규모 타겟 도메인 시나리오 텍스트 인식 벤치마크에서 성능을 얼마나 향상시키는가?

주요 결과

  • 1대10 적응(GA-DAN [10 AD])을 적용한 GA-DAN은 SVTP 데이터셋에서 51.7%의 정확도를 기록하며, 베이스라인(42.5%)과 CyCADA(43.6%) 및 CycleGAN(43.0%)과 같은 최신 기술 수준 방법들을 뛰어넘는 성능을 보였다.
  • 분리된 사이클 일치성 손실(GA-DAN [WM])은 비분리된 변형(GA-DAN [WD])보다 SVTP에서 3.1% 높은 성능을 기록하여, 기하학적 공간과 외관 공간 학습 간 균형을 효과적으로 확보함을 입증했다.
  • 외관 적응 없이 공간 변환만을 적용한 GA-DAN [WA]는 SVTP에서 36.1%의 정확도를 기록하며, 베이스라인과 무작위 변환 베이스라인을 모두 앞서는 성능을 보여, 정확한 공간 모델링의 가치를 입증했다.
  • 다중 모달 공간 학습(이미지당 10개의 시야)은 1대1 적응(GA-DAN [10 AD] 대비 GA-DAN [WM])보다 성능 향상을 이끌었으며, 다양한 공간 시야가 모델의 일반화 능력을 향상시킨다는 점을 보여주었다.
  • GA-DAN은 시각적으로 확인된 바와 같이, 투시, 곡률 등의 정확한 기하학적 특성과 블러, 조명 등의 외관 특성을 동시에 갖춘 현실적인 이미지를 생성한다(그림 5 참조). 이는 CycleGAN과 같이 외관만 적응하는 방법과는 대조된다.
  • CoGAN과 UNIT과 같은 방법들은 외관의 과도한 적응으로 인해 텍스트 의미가 변형되고 인식 가능성이 감소하여 일반화에 실패한다. 이는 도메인 적응 과정에서 기하학적 인식의 필요성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.