Skip to main content
QUICK REVIEW

[논문 리뷰] Agree to Disagree: Diversity through Disagreement for Better Transferability

Matteo Pagliardini, Martin Jaggi|arXiv (Cornell University)|2022. 02. 09.
Machine Learning and Data Classification인용 수 7
한 줄 요약

이 논문은 D-BAT를 제안하며, 이는 깊이 있는 신경망이 분포 내 데이터에서는 일치하고 분포 외 데이터(OOD)에서는 불일치하도록 유도하여 모델의 이식성과 불확실성 추정을 향상시키는 학습 알고리즘이다. 일반화된 차이를 활용해 불일치를 통해 다양성을 강제함으로써 D-BAT는 단순성 편향을 완화하고, 부적절한 특징에 대한 의존도를 줄이며, 여러 벤치마크에서 OOD 탐지 및 일반화 성능을 향상시킨다.

ABSTRACT

Gradient-based learning algorithms have an implicit simplicity bias which in effect can limit the diversity of predictors being sampled by the learning procedure. This behavior can hinder the transferability of trained models by (i) favoring the learning of simpler but spurious features -- present in the training data but absent from the test data -- and (ii) by only leveraging a small subset of predictive features. Such an effect is especially magnified when the test distribution does not exactly match the train distribution -- referred to as the Out of Distribution (OOD) generalization problem. However, given only the training data, it is not always possible to apriori assess if a given feature is spurious or transferable. Instead, we advocate for learning an ensemble of models which capture a diverse set of predictive features. Towards this, we propose a new algorithm D-BAT (Diversity-By-disAgreement Training), which enforces agreement among the models on the training data, but disagreement on the OOD data. We show how D-BAT naturally emerges from the notion of generalized discrepancy, as well as demonstrate in multiple experiments how the proposed method can mitigate shortcut-learning, enhance uncertainty and OOD detection, as well as improve transferability.

연구 동기 및 목표

  • 분포 이탈 상황에서 경사 기반 학습의 일반화 성능에 한계가 존재하는 문제를 해결하기 위해, 특히 단순한 특징에 치우친 단순성 편향으로 인해 발생하는 문제를 해결한다.
  • 분포 이탈에 강건한 다양한 이식 가능한 표현을 학습시킴으로써 딥 모델의 이식성을 향상시키는 것.
  • 분포 외 샘플에 대한 불확실성 추정을 향상시키기 위해 분포 외 데이터에서 앙상블의 불일치를 증가시키는 것.
  • 기존 방법이 부적절한 특징과 비부적절한 특징이 동일하게 예측력을 가질 때 탈편향에 실패하는 문제를 해결하는 것.
  • 상호정보량과 같은 전역 통계에 의존하지 않는 이론적으로 탄탄하고 실용적인 다양성 유도 방법을 제공하는 것.

제안 방법

  • D-BAT는 분포 내(ID) 데이터에서는 예측 불일치를 최소화하고, 분포 외(OOD) 데이터에서는 불일치를 최대화하도록 앙상블 모델을 훈련시킨다.
  • 이 방법은 데이터 분포 간 예측의 차이를 측정하는 일반화된 차이에서 유도된다.
  • ID 데이터에서는 표준 교차 엔트로피 손실를 사용하고, OOD 데이터에서는 차이 기반 손실를 사용하여 OOD 샘플에서 예측이 다를 수 있도록 유도하는 손실 함수를 사용한다.
  • 차이 손실는 각 데이터 포인트별로 계산되며, 미니배치 최적화를 가능하게 하고 전체 배치 통계가 필요로 하지 않는다.
  • 훈련 중에 OOD 데이터에 접근할 필요 없이, 적대적 편향이나 프록시 OOD 데이터를 사용해 분포 이탈을 시뮬레이션한다.
  • 앙상블 모델은 개별 모델의 예측을 조합하며, 높은 불일치는 특히 OOD 입력에서 높은 불확실성임을 나타낸다.

실험 결과

연구 질문

  • RQ1분포 내 데이터에서는 일치시키고 분포 외 데이터에서는 불일치시키는 것을 강제함으로써 분포 이탈 상황에서의 일반화 성능 향상이 가능한가?
  • RQ2부적절한 특징과 비부적절한 특징이 동일하게 예측력을 가질 때 D-BAT는 부적절한 특징에 대한 의존도를 효과적으로 줄이는가?
  • RQ3D-BAT는 상호정보량 기반의 다양성 측정 방식보다 의미 있는 모델 불일치를 더 잘 포착하는가?
  • RQ4훈련 중에 명시적인 OOD 데이터가 없어도 D-BAT는 OOD 입력에 대한 불확실성 추정을 향상시킬 수 있는가?
  • RQ5차이 기반 훈련 목표는 기존의 도메인 적응 또는 편향 제거 방법보다 더 나은 이식성을 제공하는가?

주요 결과

  • D-BAT는 단순한 부적절한 특징에 의존하는 것을 막기 위해 모델이 복잡한 특징과 동일하게 예측력을 가진 경우에도 이를 방지함으로써 단순화 학습을 크게 감소시킨다.
  • LMS-5 및 Colored-MNIST 데이터셋에서 D-BAT는 OOD 일반화 벤치마크에서 95% 이상의 테스트 정확도를 달성하여 ERM 및 기타 편향 제거 기반 베이스라인을 능가한다.
  • 표준 훈련 및 상호정보량 기반 접근 방식 대비 OOD 탐지 AUC를 최대 15%포인트 향상시킨다.
  • D-BAT의 불일치 점수는 상호정보량과 달리 직관적인 다양성 개념과 잘 일치한다. 상호정보량은 서로 반대 예측을 내는 모델을 낮은 다양성으로 잘못 판단한다.
  • 실험 결과 D-BAT의 차이 기반 손실가 상호정보량보다 더 효과적으로 다양한, OOD에 강건한 예측자들을 식별하는 데 유용하다.
  • D-BAT가 생성한 앙상블 모델은 OOD 샘플에서 더 높은 불확실성 수준을 보이며, 명시적인 OOD 데이터 없이도 불확실성 신호를 효과적으로 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.