[논문 리뷰] EDIT: Exemplar-Domain Aware Image-to-Image Translation
이 논문은 임의의 예시를 사용하여 다수의 도메인 간에 제어 가능하고 다양한 고해상도 번역을 가능하게 하는 통합 생성적 적대적 네트워크인 EDIT를 제안한다. 공유 특징 추출기와 동적이고 예시 및 도메인을 인지하는 파라미터 생성기의 조합을 통해, 이전 방법들에 비해 모델 크기와 추론 시간을 크게 줄이며 동시에 정량적 지표와 정성적 결과에서 최고 성능을 달성한다.
Image-to-image translation is to convert an image of the certain style to another of the target style with the content preserved. A desired translator should be capable to generate diverse results in a controllable (many-to-many) fashion. To this end, we design a novel generative adversarial network, namely exemplar-domain aware image-to-image translator (EDIT for short). The principle behind is that, for images from multiple domains, the content features can be obtained by a uniform extractor, while (re-)stylization is achieved by mapping the extracted features specifically to different purposes (domains and exemplars). The generator of our EDIT comprises of a part of blocks configured by shared parameters, and the rest by varied parameters exported by an exemplar-domain aware parameter network. In addition, a discriminator is equipped during the training phase to guarantee the output satisfying the distribution of the target domain. Our EDIT can flexibly and effectively work on multiple domains and arbitrary exemplars in a unified neat model. We conduct experiments to show the efficacy of our design, and reveal its advances over other state-of-the-art methods both quantitatively and qualitatively.
연구 동기 및 목표
- 정적이고 일对일 번역에 국한된 한계를 해결하기 위해 통합 프레임워크 내에서 다대다, 예시 제어 번역을 가능하게 한다.
- 다수의 도메인에서 고품질이고 다양한 출력을 유지하면서 모델 크기와 추론 시간을 줄인다.
- 동적 파라미터 생성을 통해 단일 생성기 아키텍처 내에서 도메인 인지 및 예시 인지 스타일 모델링을 통합한다.
- 사이클 일관성과 적대적 훈련을 통해 콘텐츠 무결성과 분포의 현실성을 유지한다.
- 여러 예시의 동적 파라미터를 선형 조합하여 부드러운 스타일 보간을 가능하게 한다.
제안 방법
- 모든 도메인에서 일관된 표현을 보장하기 위해 콘텐츠 특징 추출을 위한 공유 컨볼루션 블록을 사용한다.
- 스탈라이제이션 블록에 대한 도메인 및 예시별로 특화된 가중치를 생성하는 동적 파라미터 생성기가 스타일 전이를 개인화한다.
- 도메인 간 왕복 번역 시 콘텐츠를 유지하기 위해 사이클 일관성 손실을 사용한다.
- 생성된 이미지가 타겟 도메인의 분포와 일치하도록 적대적 판별기를 활용한다.
- 예시 이미지와 도메인 식별자에 조건부로 경량 파라미터 네트워크를 통해 동적 파라미터를 생성한다.
- 단일이고 컴act한 모델 내에서 임의의 예시와 다수의 도메인을 지원한다.
실험 결과
연구 질문
- RQ1통합 모델이 임의의 예시를 사용하여 다수의 도메인 간에 고품질이고 다양한 이미지 번역을 달성할 수 있는가?
- RQ2동적 파라미터 생성은 도메인 특화 및 예시 특화 스타일 정보를 효율적으로 모델링하는 데 어떻게 활용될 수 있는가?
- RQ3적대적 훈련과 사이클 일관성이 소수의 예시 기반 번역에서 콘텐츠 보존과 현실성에 어떤 영향을 미치는가?
- RQ4기존 최고 수준의 예시 기반 및 다중 도메인 번역 모델과 비교해 본다면, 제안된 방법은 효율성과 성능에서 어떤가?
- RQ5여러 예시의 동적 파라미터를 조합하여 부드러운 스타일 보간을 달성할 수 있는가?
주요 결과
- EDIT는 여러 벤치마크에서 최고 성능을 기록하며, cityscapes 데이터셋에서 FID 점수 12.4, horse2zebra 데이터셋에서 18.7을 기록하여 이전 방법들을 능가한다.
- 효율적인 동적 파라미터 생성 덕분에 저장 요구량을 476MB로 크게 줄였으며, metaNST의 870MB보다 현저히 낮다.
- 1장당 추론 속도가 4.3ms로, 예시 인지 방법 중 가장 빠르며, cycleGAN의 3.5ms에 비해 약간만 느리다.
- 시각적 결과에서는 특히 그림에서 사진으로의 번역과 같은 복잡한 케이스에서 뛰어난 콘텐츠 보존과 현실적인 스타일링을 보여준다.
- 동적 파라미터의 선형 조합을 통한 스타일 보간은 스타일 간에 부드럽고 시각적으로 일관된 전환을 생성한다.
- 절단 실험 결과 판별기와 사이클 일관성이 중요하며, 이 중 하나를 제거하면 성능이 크게 떨어진다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.