Skip to main content
QUICK REVIEW

[논문 리뷰] Semi-supervised Learning for Few-shot Image-to-Image Translation

Yaxing Wang, Salman Khan|arXiv (Cornell University)|2020. 03. 30.
Generative Adversarial Networks and Image Synthesis참고 문헌 43인용 수 4
한 줄 요약

이 논문은 소수의 레이블이 부여된 소스 이미지에 의존도를 줄이기 위해 노이즈에 강한 허위 레이블링과 사이클 일致성을 활용하는 준지도 학습 소수 샘플 이미지 간 번역 방법인 SEMIT을 제안한다. 이는 레이블이 20%뿐인 경우에도 완전히 지도 학습된 모델과 유사한 성능을 달성하며, 네 개의 데이터셋에서 10%의 레이블만으로도 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

In the last few years, unpaired image-to-image translation has witnessed remarkable progress. Although the latest methods are able to generate realistic images, they crucially rely on a large number of labeled images. Recently, some methods have tackled the challenging setting of few-shot image-to-image translation, reducing the labeled data requirements for the target domain during inference. In this work, we go one step further and reduce the amount of required labeled data also from the source domain during training. To do so, we propose applying semi-supervised learning via a noise-tolerant pseudo-labeling procedure. We also apply a cycle consistency constraint to further exploit the information from unlabeled images, either from the same dataset or external. Additionally, we propose several structural modifications to facilitate the image translation task under these circumstances. Our semi-supervised method for few-shot image translation, called SEMIT, achieves excellent results on four different datasets using as little as 10% of the source labels, and matches the performance of the main fully-supervised competitor using only 20% labeled data. Our code and models are made public at: https://github.com/yaxingwang/SEMIT.

연구 동기 및 목표

  • 이미지 간 번역을 위한 대규모 레이블이 부여된 데이터셋 확보의 높은 비용과 비현실성을 해결하기 위해.
  • 기존 소수 샘플 방법이 학습 중에 풍부한 레이블이 부여된 소스 데이터를 요구하는 한계를 극복하기 위해.
  • 학습 중에 소스 도메인으로부터 제한된 레이블만 제공되는 새로운 준지도 학습 소수 샘플 I2I 번역 설정을 탐색하기 위해.
  • 노이즈에 강한 허위 레이블링과 사이클 일치성을 통해 레이블이 없는 소스 이미지(외부 데이터 포함)를 효과적으로 활용함으로써 일반화 능력과 성능을 향상시키기 위해.
  • 저자료 환경에서 학습 효율성을 높이기 위한 일반적인 아키텍처 개선 기법(예: OctConv 및 엔트로피 조절)을 개발하기 위해.

제안 방법

  • 초기 소량의 레이블이 부여된 이미지 기반으로 노이즈에 강한 허위 레이블링 절차를 적용하여 레이블이 없는 소스 이미지에 소프트 레이블을 할당한다.
  • 콘텐츠 유지 및 레이블이 없는 이미지(동일 데이터셋 및 외부 자료 포함)의 정보를 활용하기 위해 사이클 일치 손실을 통합한다.
  • 고주파수 및 저주파수 특징을 분리하여 고주파수 이미지 세부 정보에 초점을 맞추기 위해 오르골 컨볼루션(OctConv)을 통합한다.
  • 도메인 간 불변 잠재 표현을 장려하기 위해 엔트로피 조절을 적용하여, 미리 정의되지 않은 타겟 도메인으로의 일반화 능력을 향상시킨다.
  • 레이블이 있는 데이터에 대한 분류 손실과 함께 허위 레이블링, 사이클 일치 손실을 동시에 최적화하기 위한 다단계 학습 전략을 사용한다.
  • 내부 도메인 및 외부 레이블이 없는 데이터 모두를 학습에 활용하며, 외부 데이터에는 분류 손실을 적용하지 않아 분포 이탈을 방지한다.

실험 결과

연구 질문

  • RQ1준지도 학습이 성능 저하 없이 소수 샘플 이미지 간 번역에서 레이블이 부여된 소스 이미지에 대한 의존도를 줄일 수 있는가?
  • RQ2저자료 환경에서 노이즈에 강한 허위 레이블링이 레이블이 없는 소스 이미지로부터 신뢰할 수 있는 지도 신호를 생성하는 데 얼마나 효과적인가?
  • RQ3소수 샘플 I2I 번역에서 레이블이 없는 데이터에 사이클 일치 손실을 적용할 경우 성능 향상에 어느 정도 기여하는가?
  • RQ4OctConv 및 엔트로피 조절과 같은 아키텍처 수정이 레이블이 제한된 환경에서 모델의 일반화 능력을 향상시키는 데 기여하는가?
  • RQ5내부 도메인과 외부 레이블이 없는 데이터의 조합으로 학습된 모델이 새로운 타겟 도메인으로 일반화할 수 있는가?

주요 결과

  • SEMIT는 소스 데이터의 20%만 레이블이 부여된 경우 Animals 데이터셋에서 mFID 65.21을 기록하여, 100% 레이블이 부여된 FUNIT의 66.14와 유사한 성능을 달성한다.
  • Flowers 데이터셋에서 레이블이 10%뿐인 경우 SEMIT의 mFID는 71.49이며, FUNIT가 100% 레이블을 사용했을 때의 72.64보다 뛰어난 성능을 보였다.
  • Birds 데이터셋에서 SEMIT는 20% 레이블을 사용했을 때 mFID 65.42를 기록하여, FUNIT가 100% 레이블을 사용했을 때의 66.14 성능을 근사했다.
  • 특히 Flowers와 같이 도전적인 데이터셋에서, SEMIT는 저자료 환경에서 FUNIT보다 더 현실적이고 선명한 타겟 특화 이미지를 생성한다.
  • 확장된 데이터셋(예: Animals++ 및 Birds++)을 함께 학습함으로써 시각적 품질 향상을 확인하였으며, 이는 모델이 외부 레이블이 없는 데이터를 효과적으로 활용할 수 있음을 보여준다.
  • 1-샷 및 5-샷 설정에서도 강력한 성능 유지를 보였으며, SEMIT-1은 Animals 및 Birds 데이터셋에서 모든 지표에서 경쟁 가능한 성능을 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.