[논문 리뷰] COCO-FUNIT: Few-Shot Unsupervised Image Translation with a Content Conditioned Style Encoder
COCO-FUNIT는 소수의 샘플로도 비지도 이미지 번역 성능을 향상시키기 위해 입력 콘텐츠의 구조를 유지하면서도 새로운 도메인 스타일을 전달할 수 있도록 콘텐츠 조건부 스타일 인코더와 일정한 스타일 편향을 도입한다. 이는 기존 방법에 비해 콘텐츠 손실을 크게 감소시키며, 자동 평가 지표와 인간 선호도 평가 모두에서 최신 기술 수준의 성능을 달성한다.
Unsupervised image-to-image translation intends to learn a mapping of an image in a given domain to an analogous image in a different domain, without explicit supervision of the mapping. Few-shot unsupervised image-to-image translation further attempts to generalize the model to an unseen domain by leveraging example images of the unseen domain provided at inference time. While remarkably successful, existing few-shot image-to-image translation models find it difficult to preserve the structure of the input image while emulating the appearance of the unseen domain, which we refer to as the content loss problem. This is particularly severe when the poses of the objects in the input and example images are very different. To address the issue, we propose a new few-shot image translation model, COCO-FUNIT, which computes the style embedding of the example images conditioned on the input image and a new module called the constant style bias. Through extensive experimental validations with comparison to the state-of-the-art, our model shows effectiveness in addressing the content loss problem. For code and pretrained models, please check out https://nvlabs.github.io/COCO-FUNIT/ .
연구 동기 및 목표
- 입력 이미지의 객체 구조가 스타일 전이 과정에서 왜곡되는 소수의 샘플로도 비지도 이미지 번역에서 발생하는 콘텐츠 손실 문제를 해결하기 위해.
- 추론 시 한두 장의 예시 이미지만으로도 새로운 도메인에 일반화할 수 있도록 하기 위해.
- 자세나 시점과 같은 작업에 무관한 외관 요소로부터 도메인 전용 스타일을 분리하는 스타일 인코더를 설계하기 위해.
- 다양한 객체 자세와 외관 조건에서도 사실적인 번역 품질을 유지하면서 콘텐츠 충실도를 확보하기 위해.
- 여러 개의 새로운 도메인에서 유래한 스타일 코드를 선형 조합하여 스케일링 가능한 스타일 블렌딩을 가능하게 하기 위해.
제안 방법
- 입력 콘텐츠 이미지와 일정한 스타일 편향(CSB)에 조건부로 스타일 임베딩을 계산하는 콘텐츠 조건부 스타일 인코더를 도입한다.
- 스타일 코드의 분산을 제한하기 위해 새로운 네트워크 아키텍처를 사용하여 객체 자세와 같은 비스타일 정보의 전달를 최소화한다.
- 가중치 λ를 통해 조정 가능한 학습 가능한 인자로 조절할 수 있는 일정한 스타일 편향(CSB) 모듈을 도입한다.
- 쌍체가 없는 지도 없이도 현실적이고 일관된 이미지 번역을 보장하기 위해 adversarial 학습과 사이클 일致성 손실을 적용한다.
- 콘텐츠와 스타일의 충실도 평가를 위해 세그멘테이션 마스크 매칭(mIoU, PAcc)과 fid 기반 분포 매칭(mFID)을 활용한다.
- 두 개의 다른 새로운 도메인 예시 이미지에서 유래한 스타일 코드를 선형 조합하여 스타일 보간을 가능하게 한다.
실험 결과
연구 질문
- RQ1입력 이미지와 예시 이미지 간의 객체 자세가 크게 다를 경우, 콘텐츠 조건부 스타일 인코더가 소수의 샘플 번역에서 콘텐츠 손실을 줄일 수 있는가?
- RQ2입력 콘텐츠 이미지에 조건부로 스타일 인코더를 설계함으로써 스타일 전이의 충실도와 콘텐츠 유지 능력은 어떻게 향상되는가?
- RQ3일정한 스타일 편향(CSB)이 스타일 전이의 강도와 품질 제어에 얼마나 기여하는가?
- RQ4제시된 방법은 추론 시 한두 장의 예시 이미지만으로도 새로운 도메인으로 일반화할 수 있는가?
- RQ5자동 평가 지표와 인간 선호도 평가 모두에서, 본 방법은 최신 기술 수준의 기준 모델 대비 콘텐츠 충실도와 스타일의 현실감 측면에서 어떻게 비교되는가?
주요 결과
- COCO-FUNIT는 mFID, mIoU, PAcc 및 인간 선호도 점수 모두에서 모든 데이터셋에서 FUNIT 기준 모델을 크게 앞서며 성능을 높였다.
- 다양한 자세와 외관을 가진 고난이도 소수 번역 벤치마크, 예를 들어 Carnivores 및 Birds 데이터셋에서도 최신 기술 수준의 성능을 달성했다.
- 제거 실험 결과, 콘텐츠 조건부 스타일 인코더와 일정한 스타일 편향(CSB)이 모두 필수적임을 확인했다. 둘 중 하나를 제거하면 성능이 크게 떨어졌다.
- CSB 모듈은 제어 가능한 스타일 전이를 가능하게 하며, 스케일링 인자 λ를 조절함으로써 텍스처 전용 전이에서 형태와 텍스처를 모두 전이하는 중간 상태로의 보간이 가능하다.
- 두 개의 새로운 도메인 예시에서 유래한 스타일 코드 간의 스타일 보간은 자연스럽고 사실적인 번역 결과를 생성하며, 모델이 새로운 스타일을 유연하게 생성할 수 있음을 보여준다.
- 높은 성능에도 불구하고, 극단적인 자세 불일치 또는 복잡한 배경 상호작용 상황에서는 실패 케이스가 여전히 존재하며, 보충 자료에서 이를 언급하고 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.