Skip to main content
QUICK REVIEW

[논문 리뷰] Conditional Text Image Generation with Diffusion Models

Yuanzhi Zhu, Zhaohai Li|arXiv (Cornell University)|2023. 06. 19.
Handwritten Text Recognition TechniquesComputer Science인용 수 3
한 줄 요약

이 논문은 이미지, 텍스트, 스타일 조건을 사용하여 고해상도이자 다양한 텍스트 이미지를 생성하는 확산 모델 기반 방법인 CTIG-DM을 제안한다. 이는 네 가지 다른 생성 모드를 가능하게 함으로써 텍스트 인식 정확도, OOV 단어 생성, 도메인 적응에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Current text recognition systems, including those for handwritten scripts and scene text, have relied heavily on image synthesis and augmentation, since it is difficult to realize real-world complexity and diversity through collecting and annotating enough real text images. In this paper, we explore the problem of text image generation, by taking advantage of the powerful abilities of Diffusion Models in generating photo-realistic and diverse image samples with given conditions, and propose a method called Conditional Text Image Generation with Diffusion Models (CTIG-DM for short). To conform to the characteristics of text images, we devise three conditions: image condition, text condition, and style condition, which can be used to control the attributes, contents, and styles of the samples in the image generation process. Specifically, four text image generation modes, namely: (1) synthesis mode, (2) augmentation mode, (3) recovery mode, and (4) imitation mode, can be derived by combining and configuring these three conditions. Extensive experiments on both handwritten and scene text demonstrate that the proposed CTIG-DM is able to produce image samples that simulate real-world complexity and diversity, and thus can boost the performance of existing text recognizers. Besides, CTIG-DM shows its appealing potential in domain adaptation and generating images containing Out-Of-Vocabulary (OOV) words.

연구 동기 및 목표

  • 강력한 텍스트 인식 모델을 훈련하기 위해 실제 세계의 텍스트 이미지 데이터가 제한적인 문제를 해결하기 위해.
  • 콘텐츠 유효성, 이미지 충실도, 다양성을 보장하는 조건부 텍스트 이미지 생성 프레임워크를 개발하기 위해.
  • 복잡한 텍스트 이미지, 특히 OOV 및 희귀 문자를 생성하는 데 있어 확산 모델의 잠재력을 탐색하기 위해.
  • 생성된 샘플을 활용한 데이터 합성과 도메인 적응을 통해 텍스트 인식 성능을 향상시키기 위해.

제안 방법

  • 콘텐츠, 특성, 글쓰기 스타일을 제어하기 위해 이미지 조건, 텍스트 조건, 스타일 조건이라는 세 가지 핵심 조건을 갖춘 조건부 확산 모델을 도입한다.
  • 입력 텍스트, 스타일 임베딩 및 선택적 이미지 사전 지식에서 세 조건을 생성하기 위해 조건부 인코더를 활용한다.
  • 세 입력에 조건이 붙은 노이즈 제거 확산 과정을 사용하여 랜덤 노이즈에서 사진 수준의 현실적인 텍스트 이미지를 생성한다.
  • 세 조건을 조합하거나 구성하여 생성, 증강, 복구, 모방이라는 네 가지 생성 모드를 지원한다.
  • 확산 과정에서 텍스트와 이미지 조건 간의 다중 모odal 정렬을 위해 CLIP 기반 사전 훈련을 활용한다.
  • 복잡한 문자 체계 생성을 위해 루트 시퀀스 분해 기법을 적용한다—예를 들어 OOV 중화자 및 고대 문자 체계의 경우.

실험 결과

연구 질문

  • RQ1확산 모델은 텍스트 인식의 데이터 증강을 위해 고해상도이자 다양하고 콘텐츠 유효한 텍스트 이미지를 효과적으로 생성할 수 있는가?
  • RQ2제안된 세 가지 조건(텍스트, 스타일, 이미지)이 텍스트 이미지 생성에서 이미지 품질과 의미 일관성 제어에 어떻게 기여하는가?
  • RQ3CTIG-DM은 자원이 제한되거나 도메인이 다른 설정에서 합성 데이터를 통해 텍스트 인식 성능을 얼마나 향상시킬 수 있는가?
  • RQ4CTIG-DM은 존재하지 않는 중국어 루트나 고대 문자와 같은 OOV 또는 희귀 문자의 현실적인 이미지를 생성할 수 있는가?
  • RQ5CTIG-DM은 기존의 GAN 기반 및 순차적 생성 방법과 비교해 복잡하고 유효한 텍스트 이미지를 얼마나 다양하게 생성할 수 있는가?

주요 결과

  • IAM 데이터셋에서 OOV 이미지 생성에 대해 CTIG-DM은 FID 25.52를 기록하여 이전 방법들인 CG-GAN(104.81)과 SLOGAN(97.81)을 크게 앞서며 뛰어난 성능을 보였다.
  • CVL 데이터셋에서 기준 모델 대비 CTIG-DM은 WER을 16.40% 감소시키고 CER을 7.60% 감소시켜 강력한 도메인 적응 능력을 입증했다.
  • 손글씨 및 스트리트 텍스트 환경에서의 인간 평가를 통해 CTIG-DM이 생성한 이미지는 실제 이미지와 거의 구분되지 않음을 확인했다.
  • 루트 시퀀스 조합과 스타일 사전 지식을 활용하여 존재하지 않는 중국어 문자와 고대 희귀 문자를 성공적으로 생성했다.
  • 생성, 증강, 복구, 모방이라는 네 가지 생성 모드 덕분에 다양한 텍스트 인식 시나리오에 대해 융통성 있게 적용 가능했다.
  • 모델는 예측 불가능한 글쓰는 이들 및 희귀 문자 분포에 대해 강력한 일반화 능력을 보이며, 내재된 강건성과 확장성의 잠재력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.