Skip to main content
QUICK REVIEW

[논문 리뷰] Out-of-distribution Prediction with Invariant Risk Minimization: The Limitation and An Effective Fix

Ruocheng Guo, Pengchuan Zhang|arXiv (Cornell University)|2021. 01. 16.
Domain Adaptation and Few-Shot Learning참고 문헌 35인용 수 16
한 줄 요약

이 논문은 분포 외 일반화에서 불변 위험 최소화(IRM)의 핵심적 한계를 규명한다: 허위 상관관계(예: 색상과 도메인)가 불변 상관관계(예: 형태와 클래스)보다 강할 경우, 딥 네트워크는 IRM의 정규화를 피할 수 있는 비중첩, 도메인 특화 표현을 학습할 수 있으며, 이는 분포 외 성능이 열 劣하게 된다. 이를 해결하기 위해 저자는 IRM과 조건부 분포 매칭(CDM)을 조합하는 방법을 제안하며, 이는 동일한 클래스에 대해 서로 다른 도메인 간에 겹치는 표현을 강제함으로써, 특히 강한 삼각형 허위 상관관계를 유도하는 새로운 반-합성 데이터셋(CMNIST+)에서 분포 외 정확도를 크게 향상시킨다.

ABSTRACT

This work considers the out-of-distribution (OOD) prediction problem where (1)~the training data are from multiple domains and (2)~the test domain is unseen in the training. DNNs fail in OOD prediction because they are prone to pick up spurious correlations. Recently, Invariant Risk Minimization (IRM) is proposed to address this issue. Its effectiveness has been demonstrated in the colored MNIST experiment. Nevertheless, we find that the performance of IRM can be dramatically degraded under \emph{strong $Λ$ spuriousness} -- when the spurious correlation between the spurious features and the class label is strong due to the strong causal influence of their common cause, the domain label, on both of them (see Fig. 1). In this work, we try to answer the questions: why does IRM fail in the aforementioned setting? Why does IRM work for the original colored MNIST dataset? How can we fix this problem of IRM? Then, we propose a simple and effective approach to fix the problem of IRM. We combine IRM with conditional distribution matching to avoid a specific type of spurious correlation under strong $Λ$ spuriousness. Empirically, we design a series of semi synthetic datasets -- the colored MNIST plus, which exposes the problems of IRM and demonstrates the efficacy of the proposed method.

연구 동기 및 목표

  • 허위 상관관계가 불변 상관관계보다 강할 경우 IRM이 분포 외 일반화에서 왜 실패하는지 조사하기 위해.
  • IRM이 정규화를 피하는 비중첩 표현을 학습할 수 있는 한계를 드러내기 위해.
  • IRM과 조건부 분포 매칭(CDM)을 조합하여 서로 다른 도메인 간에 겹치는, 불변 표현을 강제하는 해결책을 제안하기 위해.
  • 강한 삼각형 허위 상관관계를 유도하도록 설계된 새로운 반-합성 데이터셋(CMNIST+)에서 제안된 방법을 검증하기 위해.
  • CDM만으로는 충분하지 않지만, IRM과 조합하면 분포 외 성능이 크게 향상됨을 보여주기 위해.

제안 방법

  • 저자는 색상(허위 특징), 도메인, 클래스 간의 허위 상관관계가 형태(불변 특징)와 클래스 간의 불변 상관관계보다 강한 반-합성 데이터셋인 CMNIST+를 도입한다.
  • IRM은 동일한 클래스에 대해 서로 다른 도메인 간에 표현 분포가 유사하도록 유도하는 CDM 정규화를 추가함으로써 확장된다.
  • CDM 정규화는 특징과 클래스 레이블로부터 도메인 레이블을 예측하는 디스criminator 네트워크를 통해 구현되며, 예측된 도메인 확률과 진짜 도메인 확률 간의 KL 발산을 최소화한다.
  • 결합 손실은 번갈아가며 최소화-최대화 절차를 통해 최적화된다: 디스criminator를 통해 CDM 손실을 최대화하면서 IRM 손실을 최소화한다.
  • 두 가지 변형이 평가되었으며, 각각 IRM-MMD(다중 커널 MMD 사용)와 IRM-ACDM(MLP 디스criminator 사용)이며, 모두 공동으로 IRM과 CDM 정규화를 적용한다.
  • CMNIST+에서 다양한 삼각형 허위 상관관계 수준(ρ ∈ {0.8, 0.85, 0.9})에 대해 ERM, IRM, EIIL, 오라클 기반 모델과의 비교가 이루어졌다.

실험 결과

연구 질문

  • RQ1허위 상관관계가 불변 상관관계보다 강할 경우 IRM이 분포 외 예측에서 왜 실패하는가?
  • RQ2DNN은 경험적 리스크를 최소화하면서 IRM 정규화를 피할 수 있는 비중첩, 도메인 특화 표현을 학습할 수 있는가?
  • RQ3IRM과 조건부 분포 매칭(CDM)을 조합하면 강한 삼각형 허위 상관관계 하에서 IRM의 실패를 완화할 수 있는가?
  • RQ4이 설정에서 CDM만으로도 분포 외 일반화 문제를 해결할 수 있는가, 아니면 IRM이 반드시 필요한가?
  • RQ5학습 과정에서 도메인 레이블을 포함시키는 것이 소프트 도메인 레이블을 추론하는 방법과 비교해 불변 특징 학습에 어떤 영향을 미치는가?

주요 결과

  • 강한 삼각형 허위 상관관계(ρ > 0.75) 하에서 IRM의 성능이 크게 악화되며, CMNIST+에서 ρ = 0.85일 때 테스트 정확도가 58.47%로 떨어진다.
  • IRM-ACDM는 ρ = 0.8일 때 70.15%의 테스트 정확도를 기록하여 IRM(58.00%) 대비 12% 향상되며, CDM와 IRM을 조합하는 것이 효과적임을 입증한다.
  • IRM-MMD는 ρ = 0.8일 때 67.08%의 정확도를 기록하여 IRM 대비 9% 향상되며, CDM가 IRM의 강건성을 향상시킴을 확인한다.
  • CDM만으로는 높은 분포 외 정확도를 달성하지 못하며, ACDM는 ρ = 0.8일 때 단지 30.41%에 그쳐 CDM만으로는 부족함을 보여준다.
  • 소프트 도메인 레이블을 학습하는 EIIL은 IRM보다 성능이 열 劣하여, 명시적 도메인 감독이 불변 표현 학습에 더 효과적임을 시사한다.
  • 오라클 모델은 회색조 이미지를 사용해 허위 특징을 회피하며, ρ = 0.85일 때 73.49%의 정확도를 기록하여 제안된 방법(70.15%)이 최적 성능에 매우 가까운 것을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.