Skip to main content
QUICK REVIEW

[논문 리뷰] Calibrated ensembles can mitigate accuracy tradeoffs under distribution shift

Ananya Kumar, Tengyu Ma|arXiv (Cornell University)|2022. 07. 18.
Machine Learning and Data Classification인용 수 7
한 줄 요약

이 논문은 내재된 분포(in-distribution, ID) 데이터에서 표준 모델과 강건 모델을 별도로 校정한 후 앙상블화하는 ID 校정 앙상블(ID-calibrated ensembles)을 제안한다. 이는 11개의 자연적 분포 이탈 데이터셋에서 ID 및 외부 분포(out-of-distribution, OOD) 정확도 양면에서 최고 성능을 달성하며, OOD 데이터를 사용하지 않아도 된다. 이 방법은 90.3%의 ID 정확도와 74.5%의 OOD 정확도를 기록하여 개별 모델과 이전의 자기학습(self-training) 방법을 모두 능가한다.

ABSTRACT

We often see undesirable tradeoffs in robust machine learning where out-of-distribution (OOD) accuracy is at odds with in-distribution (ID) accuracy: a robust classifier obtained via specialized techniques such as removing spurious features often has better OOD but worse ID accuracy compared to a standard classifier trained via ERM. In this paper, we find that ID-calibrated ensembles -- where we simply ensemble the standard and robust models after calibrating on only ID data -- outperforms prior state-of-the-art (based on self-training) on both ID and OOD accuracy. On eleven natural distribution shift datasets, ID-calibrated ensembles obtain the best of both worlds: strong ID accuracy and OOD accuracy. We analyze this method in stylized settings, and identify two important conditions for ensembles to perform well both ID and OOD: (1) we need to calibrate the standard and robust models (on ID data, because OOD data is unavailable), (2) OOD has no anticorrelated spurious features.

연구 동기 및 목표

  • 강건 기계 학습에서 강건 모델이 OOD 성능을 향상시키기 위해 ID 정확도를 희생하는 일반적인 정확도 트레이드오프 문제를 해결하기 위함.
  • OOD 데이터가 필요 없이 ID 및 OOD 정확도를 모두 향상시키는 일반적이고 데이터 효율적인 방법을 개발하기 위함.
  • 내재된 분포 이탈 상황에서, 校정된 표준 모델과 강건 모델을 앙성화함으로써 ID-OOD 정확도 트레이드오프를 완화할 수 있는지 탐구하기 위함.
  • 특히 분포 이탈 하에서 임의의 특징 상관관계가 존재할 경우 ID 校정 앙상블이 성공하거나 실패하는 조건을 규명하기 위함.

제안 방법

  • 온도 스케일링을 사용하여 ID 검증 데이터에서 표준 모델과 강건 모델을 별도로 校정함으로써 신뢰도 校정을 향상시킴.
  • 교정된 표준 모델과 강건 모델의 예측을 단순히 평균 내어 앙상블화함. 이는 교정 이후 ID 성능에서 이론적으로 최적임.
  • 교정에 오직 ID 데이터만 사용함으로써 OOD 데이터에 의존하지 않으며, 이는 실무에서 흔히 발생하는 상황과 부합함.
  • 분포 이탈 상황을 평가하기 위해 앙상블을 ID 및 OOD 테스트 세트에서 평가함.
  • 독립된 신호를 가진 단순화된 설정에서 이론적 조건을 유도하기 위해 분석함.
  • ID 校정 앙상블을 ID 데이터에서 최적화된 가중치 앙성화 전략 및 자기학습 기반 기준 모델과 비교함.

실험 결과

연구 질문

  • RQ1ID 데이터에서 교정된 표준 모델과 강건 모델을 앙성화함으로써 OOD 데이터 없이도 ID 및 OOD 정확도를 향상시킬 수 있는가?
  • RQ2어떤 분포 이탈 조건에서 ID 校정 앙상블이 개별 모델 및 이전 최고 성능 방법을 능가하는가?
  • RQ3왜 자연적 분포 이탈에서는 성능이 좋지만, 반대 상관관계를 가진 임의의 특징을 가진 적대적 합성 이탈에서는 실패하는가?
  • RQ4ID 데이터에서의 모델 교정이 ID 및 OOD 성능 향상에 기여하는 역할은 무엇인가?

주요 결과

  • 11개의 자연적 분포 이탈 데이터셋에서 ID 校정 앙상블은 ID 정확도 90.3%와 OOD 정확도 74.5%를 기록하며, 표준 모델(88.7% ID, 65.2% OOD)과 강건 모델(86.8% ID, 72.3% OOD)을 모두 능가한다.
  • 추가적인 비라벨 데이터 없이도 이전 최고 성능 방법보다 뛰어난 성능을 기록한다.
  • 자연적 분포 이탈 상황에서 임의의 특징 상관관계가 OOD에서 반대일 경우, ID-OOD 정확도 트레이드오프가 사라진다.
  • 임의의 특징이 OOD 이탈에서 반대 상관관계를 가질 경우, 앙상블은 표준 모델과 강건 모델의 OOD 정확도 사이에 머물며, 이는 이론적 기대와 일치한다.
  • ID 데이터에서의 교정은 ID 데이터의 기대 교정 오차(Expected Calibration Error, ECE)를 크게 감소시키지만, OOD 교정은 여전히 열악하여 ID 교정만으로는 OOD 교정이 충분하지 않음을 시사한다.
  • 단순한 교정 모델 앙성화가 최적화된 가중치 앙성화를 능가하며, 이는 최적의 조합이 하이퍼파라미터 튜닝이 아닌 교정을 통해 달성됨을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.