Skip to main content
QUICK REVIEW

[논문 리뷰] Describe What to Change: A Text-guided Unsupervised Image-to-Image Translation Approach

Yahui Liu, Marco De Nadai|arXiv (Cornell University)|2020. 08. 10.
Multimodal Machine Learning Applications참고 문헌 53인용 수 8
한 줄 요약

이 논문은 텍스트 기반 지시(예: '머리카락 색상을 검정으로 변경')만으로도 전체 이미지 캡션이나 인간 주석이 달린 데이터셋이 필요 없이 시각적 속성의 텍스트 기반 조작을 가능하게 하는 새로운 비지도 이미지-이미지 번역 프레임워크인 DWC-GAN을 제안한다. 속성 공간에서 가우시안 믹스처 모델(GMM)을 통해 콘텐츠와 속성을 분리함으로써 자연어의 모호성을 다루기 위해 다수의 확률적이고 다양한 출력을 생성하며, CelebA 및 CUB 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Manipulating visual attributes of images through human-written text is a very challenging task. On the one hand, models have to learn the manipulation without the ground truth of the desired output. On the other hand, models have to deal with the inherent ambiguity of natural language. Previous research usually requires either the user to describe all the characteristics of the desired image or to use richly-annotated image captioning datasets. In this work, we propose a novel unsupervised approach, based on image-to-image translation, that alters the attributes of a given image through a command-like sentence such as "change the hair color to black". Contrarily to state-of-the-art approaches, our model does not require a human-annotated dataset nor a textual description of all the attributes of the desired image, but only those that have to be modified. Our proposed model disentangles the image content from the visual attributes, and it learns to modify the latter using the textual description, before generating a new image from the content and the modified attribute representation. Because text might be inherently ambiguous (blond hair may refer to different shadows of blond, e.g. golden, icy, sandy), our method generates multiple stochastic versions of the same translation. Experiments show that the proposed model achieves promising performances on two large-scale public datasets: CelebA and CUB. We believe our approach will pave the way to new avenues of research combining textual and speech commands with visual attributes.

연구 동기 및 목표

  • 전체 이미지 캡션 대신 짧고 명령어 형태의 텍스트 기반 기술을 사용해 사용자 친화적이고 영리한 이미지 속성 조작을 가능하게 하기 위해.
  • 학습에 인간 주석이 달린 이미지 캡션 데이터셋에 의존하지 않도록 하기 위해.
  • 자연어의 본질적인 모호성을 다루기 위해 다중 모odal하고 확률적인 방식으로 시각적 속성 변화를 모델링하기 위해.
  • 이미지 콘텐츠와 시각적 속성을 분리함으로써 더 제어 가능하고 강건한 이미지 번역을 가능하게 하기 위해.
  • 오직 원하는 속성 변화만을 사용해 점진적이고 보간 기반의 편집을 가능하게 하기 위해.

제안 방법

  • 모델은 콘텐츠 인코더, 속성 인코더, 생성자로 구성된 GAN 기반 아키텍처를 사용하여 이미지 콘텐츠와 시각적 속성을 분리한다.
  • 시각적 속성은 가우시안 믹스처 모델(GMM)을 사용해 모델링되며, 동일한 속성 변화에 대해 다수의 확률적 표현을 가능하게 한다.
  • 텍스트 기술은 사전 학습된 단어 임베딩을 통해 임bedding되고 속성 공간으로 투영되어 특정 속성의 수정을 안내한다.
  • 사이클 일致성 손실은 번역 과정에서 정체성 유지와 도메인 일관성을 보장한다.
  • 속성 재구성 손실은 인코딩된 표현에서 원래 속성을 정확히 재구성하도록 모델을 강제한다.
  • 다양성 민감도 손실은 동일한 입력 명령어에 대해 다수의 다릅니다만 타당한 출력을 샘플링하도록 유도한다.

실험 결과

연구 질문

  • RQ1전체 이미지 캡션 없이 짧고 명령어 형태의 텍스트 기술만으로도 이미지 속성 조작을 효과적으로 수행할 수 있는가?
  • RQ2자연어 명령어의 본질적인 모호성(예: '금발 머리'가 다양한 톤을 의미할 수 있음)을 어떻게 다룰 수 있는가?
  • RQ3비지도 접근 방식이 인간 주석이 달린 쌍화된 데이터가 없이도 고품질이고 다양한 이미지 번역을 달성할 수 있는가?
  • RQ4콘텐츠와 속성을 분리함으로써 이미지 번역의 제어성과 강건성은 어느 정도 향상되는가?
  • RQ5학습 중에 보지 못한 실제 인간이 작성한 텍스트 명령어로도 모델이 일반화할 수 있는가?

주요 결과

  • 제안된 DWC-GAN은 CelebA 및 CUB 데이터셋에서 최신 기술 수준의 성능을 달성하였으며, CelebA에서 inception score(IS)는 3.069, Fréchet Inception Distance(FID)는 32.14를 기록하였다.
  • 제거 실험 결과, 사이클 일치성 손실을 제거하면 이미지 품질과 다양성이 크게 떨어지며(IS: 2.589, FID: 97.94) 성능이 떨어짐을 확인하였다.
  • 속성 재구성 손실을 제거하면 IS와 FID는 약간 향상되지만 다양성이 감소하여 정확성과 다양성 사이의 상충 관계가 있음을 시사하였다.
  • 사전 학습된 단어 임베딩을 사용하면 학습 수렴 속도와 이미지 품질이 향상되며, 이를 제거할 경우 IS는 2.782로 낮아지고 FID는 73.90으로 상승함을 확인하였다.
  • GMM을 단일 가우시안로 제한할 경우(다양성 없음), 다중 모odal 생성 능력을 상실하며 LPIPS는 0.000 ± 0.000로 나타나 GMM이 다양성 확보에 필수적임을 입증하였다.
  • 사용자 연구(15명 참여)를 통해 실제 인간이 작성한 명령어에도 잘 일반화됨을 검증하였으며, 자연어의 다양성에 대해 강건함을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.