Skip to main content
QUICK REVIEW

[논문 리뷰] Few-shot Image Generation via Adaptation-Aware Kernel Modulation

Yunqing Zhao, Keshigeyan Chandrasegaran|arXiv (Cornell University)|2022. 10. 29.
Domain Adaptation and Few-Shot Learning인용 수 16
한 줄 요약

이 논문은 적응 인식 커널 조절(AdAM)을 제안하며, 이는 원본 도메인과 대상 도메인의 특성에 기반해 원본 모델 지식을 선택함으로써 전이 학습을 향상시키는 새로운 소수의 이미지 생성 방법이다. 기존 방법들이 원본 도메인 지식 유지를 중심으로 하던 데 비해, AdAM은 적응 인식 커널 조절을 통해 전이 가능한 특징을 식별하여, 다양한 원본-대상 도메인 유사도 조건에서 최신 기술 수준(SOTA) 성능을 달성한다. 특히 FFHQ → Cars와 같은 도전적인 설정(10장의 샘플만 존재)에서도 FID: 80.55를 기록한다.

ABSTRACT

Few-shot image generation (FSIG) aims to learn to generate new and diverse samples given an extremely limited number of samples from a domain, e.g., 10 training samples. Recent work has addressed the problem using transfer learning approach, leveraging a GAN pretrained on a large-scale source domain dataset and adapting that model to the target domain based on very limited target domain samples. Central to recent FSIG methods are knowledge preserving criteria, which aim to select a subset of source model's knowledge to be preserved into the adapted model. However, a major limitation of existing methods is that their knowledge preserving criteria consider only source domain/source task, and they fail to consider target domain/adaptation task in selecting source model's knowledge, casting doubt on their suitability for setups of different proximity between source and target domain. Our work makes two contributions. As our first contribution, we re-visit recent FSIG works and their experiments. Our important finding is that, under setups which assumption of close proximity between source and target domains is relaxed, existing state-of-the-art (SOTA) methods which consider only source domain/source task in knowledge preserving perform no better than a baseline fine-tuning method. To address the limitation of existing methods, as our second contribution, we propose Adaptation-Aware kernel Modulation (AdAM) to address general FSIG of different source-target domain proximity. Extensive experimental results show that the proposed method consistently achieves SOTA performance across source/target domains of different proximity, including challenging setups when source and target domains are more apart. Project Page: https://yunqing-me.github.io/AdAM/

연구 동기 및 목표

  • 기존 소수의 이미지 생성(FSIG) 방법들이 원본 도메인 지식 유지를 중심으로 하여 대상 도메인에 대한 적응을 忽시하는 한계를 해결한다.
  • 원본 도메인과 대상 도메인이 의미적으로 거리가 먼 경우, 기존 SOTA FSIG 방법의 성능 저하 여부를 조사한다. 이는 원근성 가정을 위반하는 경우를 뜻한다.
  • 원본 도메인과 적응 작업을 동시에 고려하여 원본 도메인에서 대상 도메인으로 전이 가능한 지식을 식별하는 방법을 개발한다.
  • 다양한 원본-대상 도메인 설정에서 일관되게 최신 기술 수준의 성능을 보여주며, 특히 FFHQ → Cars와 같이 10장의 샘플만 존재하는 도전적인 경우에도 성능을 확보한다.

제안 방법

  • 원본 모델 특징과 대상 도메인 적응 신호를 기반으로 생성기의 컨볼루션 커널 가중치를 조절하는 Adaptation-Aware Kernel Modulation(AdAM) 메커니즘을 제안한다.
  • 원본 작업뿐 아니라 대상 도메인으로의 효과적 적응을 위해 원본 모델 커널의 중요도를 평가하는 지식 유지를 위한 기준을 도입한다.
  • 대상 도메인에서 다양하고 고해상도의 이미지를 생성하는 데 가장 유용한 원본 모델 커널을 선택할 수 있도록 유연한 적응 인식 손실을 사용한다.
  • 커널 조절을 통한 수정된 GAN 손실을 사용하여 훈련함으로써, 원본 모델에서 전이 가능한 지식만을 유지하도록 모델을 조정한다.
  • 전체 생성기를 재학습하지 않고도 10~100개의 대상 샘플만으로도 소수의 파인튜닝 설정에서 적용 가능한 방법이다.
  • 사전 학습된 StyleGAN2를 원본 모델로 사용하고, 조절 가능한 커널을 가진 경량 어댑터 헤드를 통해 대상 도메인으로 적응시킨다.

실험 결과

연구 질문

  • RQ1원본 도메인과 대상 도메인이 의미적으로 거리가 먼 경우, 기존 SOTA FSIG 방법의 성능이 원근성 가정을 위반함에 따라 저하되는가?
  • RQ2원본 도메인과 적응 작업을 함께 고려하는 기준을 통해 원본 도메인에서 먼 대상 도메인으로 전이 가능한 지식을 효과적으로 식별할 수 있는가?
  • RQ3원본 도메인 중심의 기준이 아닌 적응 인식 기준에 따라 지식 유지를 유도할 경우, 소수의 이미지 생성에서 성능 향상이 뚜렷한가?
  • RQ4FFHQ → Cars와 같은 도전적인 소수의 설정에서 제안된 AdAM 방법이 초기 학습 및 다른 SOTA 기반 방법보다 어떻게 비교되는가?

주요 결과

  • 10개의 훈련 샘플만 존재하는 도전적인 FFHQ → Cars 소수 설정에서 AdAM은 Fréchet Inception Distance(FID) 80.55를 달성하며, 초기 학습(201.34)보다 유의미하게 뛰어난 성능을 보였다.
  • AdAM은 CDC(FID: 109.53) 및 DCL(FID: 125.96)를 포함한 모든 SOTA 기반 방법보다 낮은 FID와 더 높은 샘플 내 다양성(Intra-LPIPS: 0.425)을 기록하여, 뛰어난 샘플 품질과 다양성을 입증했다.
  • 원본 도메인과 대상 도메인 간의 유사도 가정을 완화할 경우, EWC 및 CDC와 같은 기존 SOTA 방법들은 단순한 파인튜닝과 성능이 유사하여, 먼 도메인 적응에서의 한계를 보였다.
  • 제거 실험 결과, AdAM의 적응 인식 지식 선택 기능이 핵심임을 확인했으며, 대상 도메인 인식 구성 요소를 제거할 경우 성능 저하가 발생했다.
  • FFHQ → Cars와 같은 먼 도메인 설정에서도 전이 가능한 지식(예: 저수준의 윤곽과 형태)이 존재하며, AdAM은 이를 효과적으로 활용하여 고품질의 이미지를 생성할 수 있었다.
  • 이 방법은 얼굴 → 유아 얼굴 등의 가까운 도메인 쌍과 얼굴 → 차량 등의 먼 도메인 쌍을 포함한 다수의 도메인 쌍에서 강력한 성능 유지를 보였으며, 일반화 능력을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.