Skip to main content
QUICK REVIEW

[논문 리뷰] SynthText3D: Synthesizing Scene Text Images from 3D Virtual Worlds

Minghui Liao, Boyu Song|arXiv (Cornell University)|2019. 07. 13.
Handwritten Text Recognition Techniques참고 문헌 47인용 수 6
한 줄 요약

이 논문은 편집 가능한 조명, 시점, 음영 조건을 갖춘 3D 가상 세계를 渲染함으로써 현실적인 시나리오 텍스트 이미지를 생성하는 새로운 방법인 SynthText3D를 제안한다. 이전 방법들이 2D 배경에 텍스트를 붙이는 방식이었던 데 반해, SynthText3D는 텍스트와 시각적 배경을 하나의 3D 시점으로 통합하여 렲성 렌더링함으로써 시각적 현실감을 향상시키고, 훨씬 적은 훈련 데이터로도 시나리오 텍스트 검출 벤치마크에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

With the development of deep neural networks, the demand for a significant amount of annotated training data becomes the performance bottlenecks in many fields of research and applications. Image synthesis can generate annotated images automatically and freely, which gains increasing attention recently. In this paper, we propose to synthesize scene text images from the 3D virtual worlds, where the precise descriptions of scenes, editable illumination/visibility, and realistic physics are provided. Different from the previous methods which paste the rendered text on static 2D images, our method can render the 3D virtual scene and text instances as an entirety. In this way, real-world variations, including complex perspective transformations, various illuminations, and occlusions, can be realized in our synthesized scene text images. Moreover, the same text instances with various viewpoints can be produced by randomly moving and rotating the virtual camera, which acts as human eyes. The experiments on the standard scene text detection benchmarks using the generated synthetic data demonstrate the effectiveness and superiority of the proposed method. The code and synthetic data is available at: https://github.com/MhLiao/SynthText3D

연구 동기 및 목표

  • 실제 시나리오 텍스트 훈련 데이터의 제한성과 높은 레이블링 비용 문제를 해결하기 위해.
  • 합성 데이터와 실제 시나리오 텍스트 이미지 간의 시각적 현실감 격차를 극복하기 위해.
  • 정확한 기하학적 및 의미적 속성을 갖춘 고품질의 합성 시나리오 텍스트 데이터를 생성하기 위해.
  • 시점 왜곡, 음영, 조명 변화와 같은 다양한 현실적인 변형을 생성하기 위해.
  • 3D 기반으로 합성된 데이터가 기존의 2D 기반 합성 데이터셋을 초월하거나 보완할 수 있음을 입증하기 위해.

제안 방법

  • 다양한 폰트의 텍스트 인스턴스를 의미론적 및 기하학적으로 적합한 위치에 3D 가상 세계에 삽입한다.
  • 그래픽 엔진을 사용하여 텍스트와 배경을 포함한 전체 3D 시점을 통합적으로 렌더링함으로써 현실적인 조명과 가시성을 확보한다.
  • 가상 카메라를 재위치 및 재정렬하여 다양한 시점과 시각적 인식을 시뮬레이션한다.
  • 표면 법선 맵을 3D 엔진에서 직접 추출하여 정확한 텍스트 배치를 유도한다.
  • 다양한 시나리오 맥락을 생성하기 위해 30종의 별도된 3D 가상 환경을 활용한다.
  • SynthText와의 공정한 비교를 위해 일관된 텍스트 생성 기법(예: 코퍼스, 색상 팔레트)을 사용하여 합성 데이터를 생성한다.

실험 결과

연구 질문

  • RQ13D 가상 세계 렌더링 방식이 2D 배경 기반 합성 방식보다 더 현실적인 시나리오 텍스트 이미지를 생성할 수 있는가?
  • RQ2기존의 합성 데이터셋 대비 3D로 합성된 데이터가 시나리오 텍스트 검출 성능 향상에 어느 정도 기여하는가?
  • RQ33D 환경의 다양성이 합성 데이터로 훈련된 모델의 일반화 능력과 성능에 어떤 영향을 미치는가?
  • RQ43D 가상 세계에서 생성된 합성 데이터가 실제 세계 데이터와 보완되어 도메인 분리 문제를 줄일 수 있는가?
  • RQ53D로 생성된 데이터를 사용해 훨씬 적은 훈련 이미지로 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • ICDAR 2015, ICDAR 2013, MLT 벤치마크에서 각각 F-측정치에서 SynthText보다 20.0%, 10.8%, 11.1% 향상된 성능을 기록했다.
  • 10개의 시나리오에서 10,000장의 이미지만으로도 SynthText의 800,000장 훈련 데이터셋을 초월하는 성능을 달성했다.
  • SynthText3D 데이터를 실제 세계 데이터와 조합하면 ICDAR 2015에서 F-측정치가 1.4% 향상되어 사전 훈련의 효과성을 입증했다.
  • 10개 시나리오에서 5,000장의 이미지와 5,000장의 VISD 이미지를 함께 훈련시켜 최고의 성능을 달성했으며, 3D와 2D 합성 데이터 간의 보완성이 입증되었다.
  • 30개의 가상 환경을 늘릴수록 성능 향상이著しい 것으로 나타나, 3D 데이터 다양성 잠재력이 여전히 남아 있음을 시사한다.
  • 2D 붙여넣기 기반 방법과 달리, 전체 3D 시점의 렌더링 덕분에 현실적인 음영, 시점 왜곡, 조명 변화를 생성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.