Skip to main content
QUICK REVIEW

[논문 리뷰] Image-to-Image Translation with Text Guidance

Bowen Li, Xiaojuan Qi|arXiv (Cornell University)|2020. 02. 12.
Multimodal Machine Learning Applications참고 문헌 26인용 수 13
한 줄 요약

이 논문은 분할 맵에서 생성된 이미지의 시각적 속성을 제어하기 위해 자연어 기술을 통합한 GAN 기반 프레임워크인 RefinedGAN을 제안한다. 문장 부호 태깅, 애핀 결합 모듈, 개선된 다단계 아키텍처, 및 구조 손실을 활용하여 COCO 데이터셋에서 기존 방법보다 우수한 현실성과 의미 일관성을 달성한다. 정성적 및 정량적 평가에서 모두 앞서는 성능을 보였다.

ABSTRACT

The goal of this paper is to embed controllable factors, i.e., natural language descriptions, into image-to-image translation with generative adversarial networks, which allows text descriptions to determine the visual attributes of synthetic images. We propose four key components: (1) the implementation of part-of-speech tagging to filter out non-semantic words in the given description, (2) the adoption of an affine combination module to effectively fuse different modality text and image features, (3) a novel refined multi-stage architecture to strengthen the differential ability of discriminators and the rectification ability of generators, and (4) a new structure loss to further improve discriminators to better distinguish real and synthetic images. Extensive experiments on the COCO dataset demonstrate that our method has a superior performance on both visual realism and semantic consistency with given descriptions.

연구 동기 및 목표

  • 자연어 기술을 사용하여 이미지 간 번역에서 특정 시각적 속성(예: 색상, 질감, 배경)을 정밀하게 제어하는 것.
  • 기존 모델이 픽셀 수준의 의미 맵에 의존하여 미세한 속성 제어가 불가능한 한계를 해결하는 것.
  • 텍스트 내 의미 단어를 생성된 이미지의 해당 시각적 속성에 정확하게 분리하고 매핑하는 것.
  • 세부 정보가 풍부한 고품질의 이미지를 단순한 분할 맵에서 생성하면서도 텍스트 프롬프트와 의미 일관성을 유지하는 것.
  • 구조적 손실과 아키텍처 개선을 통해 생성자 및 판별기 성능을 향상시키는 것.

제안 방법

  • 품사 태깅을 통해 텍스트 기술에서 의미 없는 단어를 걸러내어 잡음을 줄이고, 관련 없는 단어와 시각적 특징 간의 오해를 방지한다.
  • 애핀 결합 모듈(ACM)은 모odal별 변환을 학습하여 텍스트 및 이미지 특징을 융합함으로써 의미 단어와 이미지 영역 간 정밀한 정렬을 가능하게 한다.
  • 개선된 다단계 아키텍처는 고차수 이미지 패치를 저차수 단계로 피드백하여 판별기의 차별 능력과 생성기의 수정 능력을 향상시킨다.
  • 이 아키텍처는 저차수 단계에서 전반적인 구조와 세부 정보를 생성하고, 후속 단계에서 누락되거나 잘못된 속성을 수정함으로써 효과적인 보정을 가능하게 한다.
  • 새로운 구조 손실은 가짜 이미지의 미세한 일관성 없는 요소를 탐지할 수 있는 판별기의 능력을 향상시켜 생성기 품질을 높인다.
  • 전체 프레임워크인 RefinedGAN은 이러한 구성 요소를 통합하여 분할 맵과 자연어 기술에 조건부한 고실제성, 의미 일관성 있는 이미지를 생성한다.

실험 결과

연구 질문

  • RQ1자연어 기술이 이미지 간 번역에서 색상, 질감, 배경과 같은 특정 시각적 속성을 효과적으로 제어할 수 있는가?
  • RQ2텍스트 기술 내 의미 없는 단어는 어떻게 걸러내어 이미지 생성 품질의 열화를 방지할 수 있는가?
  • RQ3다단계 아키텍처는 생성된 이미지의 시각적 속성 분리 및 수정 능력에 얼마나 기여하는가?
  • RQ4구조 손실은 판별기가 미세한 이미지 결함을 탐지하는 능력을 향상시켜 더 높은 품질의 생성을 이끌 수 있는가?
  • RQ5제안된 방법은 세부 픽셀 수준의 맵 없이도 단순한 분할 맵에서 현실적이고 의미 일관성이 있는 이미지를 생성할 수 있는가?

주요 결과

  • 제거 실험 결과, 품사 태깅이 의미 없는 단어의 간섭을 제거하여 이미지 품질을 크게 향상시킴을 확인하였으며, 예를 들어 버스에 비현실적인 흰색 패치가 생기는 것을 방지하였다.
  • 애핀 결합 모듈은 단순한 연결보다 특징 융합에서 뛰어난 성능을 보이며, 텍스트 의미와 이미지 영역 간 정확한 정렬을 가능하게 하고 의미 일관성을 유지한다.
  • 개선된 다단계 아키텍처는 누락되거나 잘못된 속성의 보정에 효과적이며, 예를 들어 점박이 무당이어의 머리와 뒷부분을 복원하거나 버스의 녹색 창문을 수정하는 데 성공하였다.
  • 구조 손실을 제거할 경우 비현실적인 이미지 영역(예: 버스에 패치가 생기거나 비행기의 질감이 떨어지는 등)이 발생함을 통해, 이 손실이 미세한 결함에 대한 판별기 민감도를 향상시키는 데 기여함을 입증하였다.
  • 전체 RefinedGAN 모델은 COCO 데이터셋에서 세부 정보가 풍부하고 의미 일관성이 높은 고품질 이미지를 생성하였으며, 정성적 및 정량적 평가에서 최신 기준 모델을 모두 앞서는 성능을 보였다.
  • 모델은 단순한 마스크와 텍스트 프롬프트를 기반으로 다수의 객체와 관계를 포함한 복잡한 장면(예: 숲 속의 점박이 무당이어, 회색 하늘에 노란 기체의 전투기)을 성공적으로 생성하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.