Skip to main content
QUICK REVIEW

[논문 리뷰] Decomposed Mutual Information Estimation for Contrastive Representation Learning

Alessandro Sordoni, Nouha Dziri|arXiv (Cornell University)|2021. 06. 25.
Domain Adaptation and Few-Shot Learning인용 수 11
한 줄 요약

이 논문은 사슬 법칙을 사용하여 상호정보량(MI) 추정을 조건부 및 무조건부 MI 항의 합으로 분해하는 방법인 분해된 상호정보량 추정(DEMI)을 제안한다. 점차 더 많은 정보를 담은 부분 시각(subviews)에서 훈련함으로써 DEMI는 MI 추정의 편향을 줄이고, 표준 대비 기반 대비 기반의 표현 학습보다 시각 및 대화 작업에서 더 나은 표현을 달성한다.

ABSTRACT

Recent contrastive representation learning methods rely on estimating mutual information (MI) between multiple views of an underlying context. E.g., we can derive multiple views of a given image by applying data augmentation, or we can split a sequence into views comprising the past and future of some step in the sequence. Contrastive lower bounds on MI are easy to optimize, but have a strong underestimation bias when estimating large amounts of MI. We propose decomposing the full MI estimation problem into a sum of smaller estimation problems by splitting one of the views into progressively more informed subviews and by applying the chain rule on MI between the decomposed views. This expression contains a sum of unconditional and conditional MI terms, each measuring modest chunks of the total MI, which facilitates approximation via contrastive bounds. To maximize the sum, we formulate a contrastive lower bound on the conditional MI which can be approximated efficiently. We refer to our general approach as Decomposed Estimation of Mutual Information (DEMI). We show that DEMI can capture a larger amount of MI than standard non-decomposed contrastive bounds in a synthetic setting, and learns better representations in a vision domain and for dialogue generation.

연구 동기 및 목표

  • 큰 양의 상호정보량을 측정할 때 대비 기반 상호정보량(MI) 추정에서의 과소추정 편향을 해결하기 위해.
  • 사슬 법칙을 사용하여 전체 MI 추정 문제를 더 작고 다룰 수 있는 하위 문제들로 분해함으로써 표현 학습을 향상시키기 위해.
  • 조건부 MI에 대한 대비 하한을 개발하여 효율적인 최적화를 가능하게 하기 위해.
  • 상호정보량 추정을 분해함으로써 시각 및 대화 생성 작업에서 더 나은 최종 표현을 달성할 수 있음을 입증하기 위해.

제안 방법

  • 두 시각 x와 y 사이의 상호정보량 I(x; y)를 사슬 법칙을 사용해 항의 합으로 분해한다: I(x; y) = I(x′; y) + I(x; y|x′), 여기서 x′은 x의 부분 시각이다.
  • 무조건부 MI 항 I(x′; y)를 표준 대비 기반 학습을 통해 무작위로 샘플링된 음성 예시들(마진발 분포 p(y)에서 유래)을 사용하여 최대화한다.
  • 조건부 MI 항 I(x; y|x′)에 대한 대비 하한을 설정하기 위해 x′을 사용해 p(y|x′)에서 어려운 음성 예시들을 생성함으로써 효율적인 최적화를 가능하게 한다.
  • 대화 작업에서 p(y|x′)를 모델링하기 위해 변분 근사(예: GPT2)를 사용하여 미래의 음성 예시들을 생성한다.
  • 인코더를 훈련시켜 양성 쌍 (x, y)과 p(y|x′)에서 샘플링된 y′로부터 유도된 음성 쌍 (x, y′)을 구별하도록 하여, 조건부 MI를 효과적으로 최대화한다.
  • 일반화성을 검증하기 위해 시각(이미지 증강) 및 순차적(대화) 설정 모두에 이 방법을 적용한다.

실험 결과

연구 질문

  • RQ1상호정보량 추정을 더 작은 조건부 및 무조건부 항들로 분해함으로써 대비 기반 상호정보량 추정의 편향을 줄일 수 있는가?
  • RQ2조건부 MI I(x; y|x′)를 최대화하는 것이 무조건부 MI I(x; y)만 최대화하는 것보다 더 나은 표현 학습을 이끌어내는가?
  • RQ3제안된 조건부 MI에 대한 대비 하한은 다양한 데이터 모odalities에 걸쳐 효율적으로 최적화되고 일반화 가능한가?
  • RQ4DEMI는 표준 대비 기반 방법 및 다른 MI 최대화 베이스라인에 비해 최종 표현 품질에서 어떻게 성능을 냈는가?
  • RQ5분해 전략은 시각 및 순차적(대화) 표현 학습 작업 모두에서 성능 향상에 기여하는가?

주요 결과

  • 합성 상호정보량 추정 설정에서 DEMI는 표준 비분해 대비 기반 하한보다 유의미하게 더 많은 상호정보량을 캡처한다.
  • 시각 작업에서 DEMI는 InfoNCE 및 기타 베이스라인에 비해 더 나은 최종 성능을 보이는 표현을 학습한다.
  • 대화 생성 작업에서 DEMI는 자동 평가 지표와 인간 평가를 통해 더 높은 품질의 응답을 생성한다.
  • 인간 평가 결과, α=0.01에서 DEMI로 생성된 응답은 InfoNCE 및 기존 모델에 비해 유의미하게 더 선호되었다.
  • MultiWOZ 2.0 대화 벤치마크에서 상태의 최고 성능을 기록했으며, GPT2, TransferTransfo 및 GPT2-MMI를 모두 앞섰다.
  • 제거 실험을 통해 조건부 MI 항이 표현 품질에 의미 있는 기여를 하며, 특히 순차적 데이터에서 장기적 의존성을 포착하는 데 기여한다는 것이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.