Skip to main content
QUICK REVIEW

[논문 리뷰] Domain Generalization by Mutual-Information Regularization with Pre-trained Models

Junbum Cha, Kyungjae Lee|arXiv (Cornell University)|2022. 03. 21.
Domain Adaptation and Few-Shot Learning인용 수 9
한 줄 요약

이 논문은 사전 훈련된 모델과 타겟 모델 간의 상호정보를 최대화하여 강건하고 도메인 불변 표현을 학습하는 도메인 일반화 방법인 MIRO를 제안한다. 대규모 사전 훈련된 백본을 사용해 이상적인 오라클 모델을 근사함으로써, MIRO는 DomainBed 벤치마크에서 최신 기술 수준의 성능을 달성한다. 특히 CLIP와 SWAG와 같은 더 큰 사전 훈련된 모델을 사용할 경우 두드러진 성능 향상을 보인다.

ABSTRACT

Domain generalization (DG) aims to learn a generalized model to an unseen target domain using only limited source domains. Previous attempts to DG fail to learn domain-invariant representations only from the source domains due to the significant domain shifts between training and test domains. Instead, we re-formulate the DG objective using mutual information with the oracle model, a model generalized to any possible domain. We derive a tractable variational lower bound via approximating the oracle model by a pre-trained model, called Mutual Information Regularization with Oracle (MIRO). Our extensive experiments show that MIRO significantly improves the out-of-distribution performance. Furthermore, our scaling experiments show that the larger the scale of the pre-trained model, the greater the performance improvement of MIRO. Source code is available at https://github.com/kakaobrain/miro.

연구 동기 및 목표

  • 기존 도메인 일반화 방법이 소스 도메인 편향에 과적합되면서 큰 분포 이탈 상황에서 실패하는 데 기인한 한계를 해결하기 위해.
  • 모든 도메인에 일반화 가능한 오라클 모델과 타겟 모델 간의 상호정보를 최대화하는 방식으로 도메인 일반화 문제를 재정의하기 위해.
  • 기하학적으로 계산이 불가능한 오라클 모델을 대체하기 위해 대규모 사전 훈련된 모델을 사용해 실용적인 최적화를 가능하게 하는 방법을 개발하기 위해.
  • 더 큰 사전 훈련된 모델을 MIRO와 결합할 경우, 단순한 미세조정과는 달리 일반화 성능이 크게 향상됨을 보여주기 위해.
  • 아키텍처 변경 없이도 복잡한 훈련 프로토콜 없이도 적용 가능한 즉시 사용 가능한 정규화 방법을 제공하기 위해.

제안 방법

  • 타겟 모델의 특징과 오라클 모델의 특징 간의 상호정보를 최대화하는 방식으로 도메인 일반화 목표를 재정의한다.
  • 목표 함수를 실현 가능하게 하기 위해 대규모 사전 훈련된 모델(예: ImageNet, CLIP, SWAG)을 사용해 오라클 모델을 근사한다.
  • 상호정보 목표의 변분 하한을 유도하여, 사전 훈련된 모델과 타겟 모델의 표현 간에 미분 가능한 정규화 항을 도출한다.
  • 표준 경험 리스크 최소화(ERM) 목표와 상호정보 정규화 항을 하이퍼파rameter λ로 제어하여 결합한다.
  • 사전 훈련된 모델을 초기화 및 오라클 근사치로 동시에 사용함으로써, 어떤 백본이나 데이터셋과도 즉시 통합이 가능한 플러그 앤 플레이 통합을 가능하게 한다.
  • 미세조정 설정에서 이 방법을 적용함으로써, 정규화가 타겟 모델이 사전 훈련된 모델의 강건하고 일반화된 특징과 일치하도록 유도한다.

실험 결과

연구 질문

  • RQ1가상의 오라클 모델과의 상호정보를 최대화하는 것이 도메인 불변 특징을 학습하는 것 이상의 도메인 일반화 성능 향상을 이끌 수 있는가?
  • RQ2대규모 사전 훈련된 모델을 사용해 오라클 모델을 근사하면, 표준적인 미세조정보다 더 나은 분포 외 일반화 성능을 달성할 수 있는가?
  • RQ3사전 훈련된 모델의 규모가 MIRO의 성능 향상에 어떤 영향을 미치는가?
  • RQ4이상적인 오라클 모델과의 상호정보 정규화가, ImageNet과 의료 영상 데이터셋 간과 같은 큰 분포 이탈 상황에서도 효과적인가?
  • RQ5기존의 앙상블 방법과 MIRO를 조합하면 더 높은 강건성을 확보할 수 있는가?

주요 결과

  • MIRO는 DomainBed 벤치마크에서 모든 설정에서 기존의 모든 방법을 능가하는 최신 기술 수준의 성능을 달성한다. 다양한 옵timizer와 사전 훈련된 모델을 사용한 모든 경우에 적용 가능하다.
  • ImageNet으로 사전 훈련된 ResNet-50을 사용할 경우, MIRO는 평균 정확도를 ERM의 64.2%에서 65.9%로 향상시켜 +1.7% 향상되었다.
  • CLIP로 사전 훈련된 ViT-B를 사용할 경우, MIRO는 평균 정확도를 ERM의 61.1%에서 73.7%로 향상시켜 +12.6% 향상되었으며, 이는 대규모 사전 훈련된 모델에서 매우 높은 성능 향상을 보여준다.
  • SWAG로 사전 훈련된 RegNetY-16GF를 사용할 경우, MIRO는 평균 정확도를 ERM의 68.0%에서 74.1%로 향상시켜 +6.1% 향상되었다.
  • SWAD 앙상블 방법과 함께 MIRO를 사용하면, SWAG 백본에서 평균 정확도가 77.3%로 더욱 향상되었다.
  • 특히 CLIP와 SWAG와 같은 대규모 사전 훈련된 모델을 사용할 경우, MIRO는 단순한 미세조정보다 오라클 모델과 더 높은 상호정보를 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.