Skip to main content
QUICK REVIEW

[논문 리뷰] Variational Interaction Information Maximization for Cross-domain Disentanglement

HyeongJoo Hwang, Geon-Hyeong Kim|arXiv (Cornell University)|2020. 12. 08.
Domain Adaptation and Few-Shot Learning참고 문헌 43인용 수 21
한 줄 요약

이 논문은 정보 이론적 정규화를 사용하여 적대적 훈련이나 기울기 반전 없이 도메인 불변 및 도메인 특화 표현을 분리하는 변동형 추론 기반 생성 모델인 상호정보자동에코더(IIAE)를 제안한다. IIAE는 외부 지식(예: 단어 임베딩)이 없어도 Sketchy Extended에서 제로샷 스케치 기반 이미지 검색(ZS-SBIR)에서 최고 성능을 기록한다(mAP: 0.573, P@100: 0.659).

ABSTRACT

Cross-domain disentanglement is the problem of learning representations partitioned into domain-invariant and domain-specific representations, which is a key to successful domain transfer or measuring semantic distance between two domains. Grounded in information theory, we cast the simultaneous learning of domain-invariant and domain-specific representations as a joint objective of multiple information constraints, which does not require adversarial training or gradient reversal layers. We derive a tractable bound of the objective and propose a generative model named Interaction Information Auto-Encoder (IIAE). Our approach reveals insights on the desirable representation for cross-domain disentanglement and its connection to Variational Auto-Encoder (VAE). We demonstrate the validity of our model in the image-to-image translation and the cross-domain retrieval tasks. We further show that our model achieves the state-of-the-art performance in the zero-shot sketch based image retrieval task, even without external knowledge. Our implementation is publicly available at: https://github.com/gr8joo/IIAE

연구 동기 및 목표

  • 히우리 정규화 기법에 의존하지 않고, 분리된 표현과 정보가 풍부한 표현을 동시에 학습함으로써 교차 도메인 분리 문제를 해결하는 것.
  • 정보 이론에 기반한 제약 조건을 통해 도메인 불변 및 도메인 특화 표현의 공동 학습을 제약 최적화 문제로 정식화하는 것.
  • VAE의 기초 하한값(ELBO)과 자연스럽게 통합되는, 목적 함수의 계산 가능한 하한값을 도출하는 것.
  • 이러한 방법이 이미지 간 번역, 교차 도메인 검색, 제로샷 스케치 기반 이미지 검색 등 다양한 작업에서 효과적임을 보여주는 것.
  • 단어 임베딩이나 속성 주석과 같은 외부 지식이 없이도 IIAE가 최고 성능을 기록하는지 확인하는 것.

제안 방법

  • 교차 도메인 분리를 다중 정보 제약 조건의 동시 최적화 문제로 공식화한다: 입력과 공통 표현 간 상호정보를 최대화하고, 공통 표현과 도메인 특화 요소 간 상호정보를 최소화한다.
  • 구조적 사후 근사 qφ(zx, zs, zy|x, y) = qφX(zx|x)qφS(zs|x, y)qφY(zy|y)를 사용하는 변동형 추론 프레임워크를 도입하여 엔드 투 엔드 훈련을 가능하게 한다.
  • 목적 함수는 ELBO와 두 정보 정규화 항을 조합한 하한값으로 도출되며, 하나는 공통 표현 ZS가 최소 충분통계량이 되도록 하기 위해 I(ZS; ZX, ZY)를 최소화하는 항이고, 다른 하나는 ZS가 (X, Y)에 대해 최대한 정보가 되도록 하기 위해 I(ZS; X, Y)를 최대화하는 항이다.
  • 공통 표현의 불변성과 압축성 간의 트레이드오프를 조정하기 위해 하이퍼파rameter λ를 사용한다.
  • 적대적 훈련이나 기울기 반전 레이어가 필요 없이, backpropagation을 통해 훈련되는 생성 모델로 구현된다.
  • 공통 표현 ZS는 코사인 유사도를 통해 이미지 검색과 같은 후속 작업에 사용된다.

실험 결과

연구 질문

  • RQ1적대적 훈련이나 기울기 반전 없이도, 정보 이론적 원칙에 기반한 프레임워크를 설계하여 분리된 도메인 불변 및 도메인 특화 표현을 동시에 학습시킬 수 있는가?
  • RQ2엔드 투 엔드 훈련을 위해 공통 표현과 독립 표현 간의 상호정보 제약 조건을 계산 가능한 방식으로 근사할 수 있는가?
  • RQ3제안된 방법이 교차 도메인 이미지 번역 및 검색 작업에서 분리 품질과 후속 작업 성능을 어느 정도 향상시키는가?
  • RQ4단어 임베딩이나 속성 레이블과 같은 외부 지식이 없이도 모델이 제로샷 스케치 기반 이미지 검색에서 최고 성능을 낼 수 있는가?
  • RQ5공통 표현이 일반화된 새로운 클래스에 대해 최소 충분통계량으로서 수행하는 역할은 무엇인가?

주요 결과

  • IIAE는 외부 지식(예: 단어 임베딩 또는 WordNet)이 없어도 Sketchy Extended 데이터셋을 기반으로 한 제로샷 스케치 기반 이미지 검색(ZS-SBIR) 벤치마크에서 최고 성능을 기록하며, mAP는 0.573, P@100는 0.659를 기록한다.
  • 단어 수준이나 속성 주석이 없는 전용 기반 모델인 LCALE(mAP: 0.476)과 SEM-PCYC(mAP: 0.349)를 모두 초월하여, 속성 또는 단어 수준의 감독 없이도 효과적임을 입증한다.
  • 제거 실험 결과, I(ZS; ZX, ZY) 최소화와 I(ZS; X, Y) 최대화를 위한 두 정보 정규화 항 모두 성능 향상에 필수적이며, λ가 불변성과 정보성 간 균형을 조절함을 확인한다.
  • 정성적 결과로, 잘못 검색된 이미지들 역시 질문 이미지와 시각적 또는 의미적 유사성을 보이며, 공통 표현이 의미 있는 의미적 구조를 포착하고 있음을 시사한다.
  • 공통 표현이 최소 충분통계량이기 때문에, 새로운 클래스에 대한 일반화 능력이 뛰어나지며, 이는 제로샷 검색에서 높은 성능을 기록한 데 기인한다.
  • 이미지 간 번역 및 교차 도메인 검색 작업에서도 뛰어난 성능을 기록하여, ZS-SBIR를 넘어서도 광범위한 적용 가능성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.