Skip to main content
QUICK REVIEW

[논문 리뷰] On Calibration and Out-of-domain Generalization

Yoav Wald, Amir Feder|arXiv (Cornell University)|2021. 02. 20.
Domain Adaptation and Few-Shot Learning참고 문헌 41인용 수 10
한 줄 요약

이 논문은 기계학습에서 도메인 외 일반화(OOD)를 위한 실용적이고 이론적으로 타당한 대체 기준으로 다중 도메인 校정을 제안한다. 여러 도메인에서 동시적으로 校정이 이루어지면 임의의 상관관계가 없음을 보여줌으로써, 저자들은 다중 도메인 ECE를 통한 모델 선택, 강건한 등방성 회귀, 그리고 종단 간 校정 훈련과 같은 방법을 도입하여 WILDS 및 Colored MNIST 벤치마크에서 OOD 성능을 향상시킨다.

ABSTRACT

Out-of-domain (OOD) generalization is a significant challenge for machine learning models. Many techniques have been proposed to overcome this challenge, often focused on learning models with certain invariance properties. In this work, we draw a link between OOD performance and model calibration, arguing that calibration across multiple domains can be viewed as a special case of an invariant representation leading to better OOD generalization. Specifically, we show that under certain conditions, models which achieve \emph{multi-domain calibration} are provably free of spurious correlations. This leads us to propose multi-domain calibration as a measurable and trainable surrogate for the OOD performance of a classifier. We therefore introduce methods that are easy to apply and allow practitioners to improve multi-domain calibration by training or modifying an existing model, leading to better performance on unseen domains. Using four datasets from the recently proposed WILDS OOD benchmark, as well as the Colored MNIST dataset, we demonstrate that training or tuning models so they are calibrated across multiple domains leads to significantly improved performance on unseen test domains. We believe this intriguing connection between calibration and OOD generalization is promising from both a practical and theoretical point of view.

연구 동기 및 목표

  • 강력한 도메인 내 성능에도 불구하고 새로운 분포에서 실패하는 기계학습 모델의 도메인 외(OOD) 일반화 문제를 다루는 것.
  • 고차원 데이터에 스케일링이 어려우며 종종 임의의 상관관계를 제거하지 못하는 기존의 불변 표현 학습 방법에 존재하는 핵심적 격차를 규명하는 것.
  • 다양한 도메인에서의 모델 校정과 임의의 상관관계 부재 사이의 이론적 연결 고리를 설정하여, 校정을 불변성의 대체 기준으로 프레임워크화하는 것.
  • 실제 세계 상황에서 다중 도메인 校정을 향상시키기 위한 실용적이고 훈련 가능한, 측정 가능한 방법을 개발하는 것.
  • 다양한 벤치마크, 특히 WILDS 및 Colored MNIST를 포함하여, 다중 도메인 校정을 최적화함으로써 OOD 정확도에서 뚜렷한 향상이 이루어짐을 경험적으로 입증하는 것.

제안 방법

  • 모든 훈련 도메인에 대한 평균 ECE로 정의된, 여러 환경에서의 校정 수준을 측정하는 다중 도메인 기대 校정 오차(ECE) 점수를 제안한다.
  • 도메인 내 정확도를 원하는 기준치로 제약하면서 다중 도메인 ECE를 최소화하는 방식으로 모델 선택을 도입함으로써 정확도와 강건성 사이의 트레이드오프를 가능하게 한다.
  • 모델 재학습 없이도 도메인 간 校정을 향상시키기 위해 강건한 등방성 회귀를 후처리 단계로 적용한다.
  • Kumar 등(2018)의 방법을 사용하여 다중 도메인 校정을 직접 최적화하는 종단 간 훈련 목표를 설정함으로써 딥 네트워크가 校정된 불변 표현을 학습하도록 유도한다.
  • 인과 모델링을 통해 인과적, 반인과적 비임의적, 반인과적 임의적 특징을 구분하여 이론적 분석을 구조적 인과 모델에 기반으로 한다.
  • 이론적 분석을 통해 일반 위치 조건 하에서 가우시안-선형 모델에서 다중 도메인 校정은 임의의 상관관계 부재를 암시함을 증명하며, 이는 제안된 접근의 공식적 정당성을 제공한다.

실험 결과

연구 질문

  • RQ1다중 도메인 校정은 도메인 외 일반화를 위한 측정 가능하고 훈련 가능한 대체 기준이 될 수 있는가?
  • RQ2다중 도메인 校정이 모델에서 임의의 상관관계 부재를 암시하는 조건은 무엇인가?
  • RQ3OOD 성능 측면에서 기존의 불변성 기반 방법, 예를 들어 불변 위험 최소화(IRM)에 비해 다중 도메인 校정은 어떻게 비교되는가?
  • RQ4등방성 회귀와 같은 후처리 기법을 통해 강화된 校정을 통해 OOD 일반화는 어느 정도 향상되는가?
  • RQ5다중 도메인 校정을 최적화함으로써 다양한 벤치마크 데이터셋에서 일관된 OOD 정확도 향상이 이루어지는가?

주요 결과

  • 일반 위치 조건 하에서 가우시안-선형 모델에서 충분한 수의 도메인에서 동시 校정이 이루어지면 임의의 상관관계가 반드시 제거됨을 증명할 수 있다.
  • 다중 도메인 ECE를 최소화하는 방식으로 모델 선택을 수행하면, 0.25,0.9 분포를 가진 테스트 환경에서 OOD 정확도가 64.98%에 도달하며, 도메인 내 정확도에만 기반해 모델을 선택하는 것보다 우수한 성능을 보인다.
  • IRMv1이 OOD 정확도 기준으로 모델 순위를 정하지 못하는 실패 케이스에서, 제안된 방법은 IRMv1보다 훨씬 더 우수한 OOD 성능을 달성한다.
  • 강건한 등방성 회귀 후처리를 통해 도메인 간 校정이 향상되고, 재학습 없이도 OOD 일반화가 향상된다.
  • WILDS 벤치마크에서 다중 도메인 校정 목표를 갖는 딥 네트워크 훈련은 CivilComments 및 CAMELYON17 데이터셋에서 뚜렷한 OOD 정확도 향상을 이룬다.
  • 특히 IRM이 실패하는 도전적인 분포 이동 상황에서, 훈련 환경의 평균 ECE는 IRMv1 페널티보다 OOD 성능과 더 신뢰성 있게 상관관계를 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.