Skip to main content
QUICK REVIEW

[논문 리뷰] TSIT: A Simple and Versatile Framework for Image-to-Image Translation

Liming Jiang, Changxu Zhang|arXiv (Cornell University)|2020. 07. 23.
Generative Adversarial Networks and Image Synthesis참고 문헌 52인용 수 6
한 줄 요약

TSIT는 단순하고 통합된 프레임워크를 제안하며, 다중 척도 특징 정규화(Fade 및 FAdaIN)를 사용하는 대칭적 이중 스트림 네트워크를 통해 콘텐츠 구조와 스타일 표현을 동시에 모델링한다. 사이클 일致성 또는 작업별 제약 조건 없이도 비지도 및 지도 학습 설정 모두에서 최고 수준의 성능을 달성하여, 임의의 스타일 제어가 가능한 고해상도 다중 모달 이미지 합성을 가능하게 한다.

ABSTRACT

We introduce a simple and versatile framework for image-to-image translation. We unearth the importance of normalization layers, and provide a carefully designed two-stream generative model with newly proposed feature transformations in a coarse-to-fine fashion. This allows multi-scale semantic structure information and style representation to be effectively captured and fused by the network, permitting our method to scale to various tasks in both unsupervised and supervised settings. No additional constraints (e.g., cycle consistency) are needed, contributing to a very clean and simple method. Multi-modal image synthesis with arbitrary style control is made possible. A systematic study compares the proposed method with several state-of-the-art task-specific baselines, verifying its effectiveness in both perceptual quality and quantitative evaluations.

연구 동기 및 목표

  • 지도 및 비지도 설정 모두에서 작동하는 통합형, 작업 무관 프레임워크를 개발하는 것.
  • 학습 복잡도를 증가시키고 일반화 능력을 떨어뜨리는 사이클 일치성과 같은 작업별 제약 조건에 의존하지 않도록 하는 것.
  • 단일 모델을 통해 제어 가능한 스타일 전이 기능을 갖춘 고품질, 다중 모달 이미지 합성을 가능하게 하는 것.
  • 粗-세밀 다중 척도 정규화 방식을 통해 의미적 구조와 스타일의 특징 수준 융합을 향상시키는 것.
  • 철저히 설계된 정규화 레이어를 갖춘 최소한의 깔끔한 아키텍처가 복잡한 작업별 베이스라인을 능가할 수 있음을 보여주는 것.

제안 방법

  • 프레임워크는 대칭적인 이중 스트림 생성기 구조를 사용한다: 한 스트림은 콘텐츠 구조를 인코딩(콘텐츠 스트림), 다른 스트림은 스타일 표현을 인코딩(스타일 스트림).
  • 콘텐츠 스트림에서 특징 적응형 탈정규화(FADE)를 적용하여 다중 척도 특징에서 공간적 구조를 유지한다.
  • 스타일 스트림에서 특징 적응형 인스턴스 정규화(FAdaIN)를 사용하여 다중 수준에서 스타일 정보를 주입한다.
  • 콘텐츠와 스타일에 동시 조건부를 부여할 수 있는 일관된 특징 변환 방식을 통해 두 스트림을 융합한다.
  • 사이클 일치성이나 픽셀 수준의 감독과 같은 추가 제약 없이 표준 손실(대비 및 인지적 손실)을 사용한다.
  • 아키텍처는 엔드 투 엔드로 훈련되며, 비지도(예: 임의의 스타일 전이) 및 지도(예: 의미적 이미지 합성) 작업에 직접 적용 가능하다.

실험 결과

연구 질문

  • RQ1작업별 구성 요소 없이도 다양한 이미지 간 번역 작업에서 강력한 성능을 달성할 수 있는 통합 프레임워크가 가능한가?
  • RQ2다중 척도 특징 정규화(FADE 및 FAdaIN)가 이미지 생성에서 의미적 구조와 스타일을 포괄적으로 포착하는 데 얼마나 효과적인가?
  • RQ3공유된 정규화 체계를 갖춘 이중 스트림 아키텍처가 단일 스트림 또는 작업별 설계에 비해 정밀도와 다양성 측면에서 뛰어나게 성능을 내는가?
  • RQ4표준 손실만으로도 임의의 스타일 제어가 가능한 고품질 다중 모달 출력을 생성할 수 있는가?
  • RQ5역방향 설정, 즉 지도 모델을 비지도 번역에, 또는 반대로 비지도 모델을 지도 번역에 적용했을 때 프레임워크의 성능은 어떠한가?

주요 결과

  • ADE20K 데이터셋에서 TSIT는 mIoU 65.9와 정확도 82.7%를 기록하여 SPADE 및 CC-FPSE와 같은 이전 방법들을 능가한다.
  • BDD100K 데이터셋에서 TSIT는 다중 모달 시간 및 날씨 번역 작업에서 FID 31.6을 달성하여 최고 수준의 베이스라인과 동등하거나 이를 초월한다.
  • 절단 실험 결과, 콘텐츠 스트림을 제거할 경우 구조적 아티팩트가 발생하고, 스타일 스트림을 제거할 경우 다중 모달 합성이 불가능해짐을 확인했다.
  • 역방향 설정에서도 강력한 성능 유지를 보였으며, MUNIT 및 SPADE와 같은 전용 모델보다도 불일치한 작업에 적용했을 때 성능이 뛰어나게 나타났다.
  • FADE 및 FAdaIN의 사용은 도전적인 스타일 전이 조건에서도 고해상도, 사실적인 이미지 생성을 가능하게 하며 최소한의 아티팩트를 유발한다.
  • TSIT는 사이클 일치성이나 복잡한 아키텍처 수정 없이도 여러 벤치마크에서 최고 성능을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.