Skip to main content
QUICK REVIEW

[논문 리뷰] SelecMix: Debiased Learning by Contradicting-pair Sampling

Inwoo Hwang, Sang-Jun Lee|arXiv (Cornell University)|2022. 11. 04.
Machine Learning and Data Classification인용 수 4
한 줄 요약

SelecMix는 비편향 특징이 유사한 예시들(같은 레이블이지만 비편향 특징이 다를 경우) 또는 비편향 특징이 다를 수 있는 예시들(다른 레이블이지만 비편향 특징이 유사한 경우)인 모순 쌍에 대해 mixup를 적용함으로써 편향 충돌을 일으키는 훈련 샘플을 생성하는 비편향 학습 방법을 제안한다. 쉽게 학습 가능한 비편향 특징에 초점을 맞춘 보조 대비 모델을 통해 이러한 쌍을 명시적인 편향 레이블이나 분리된 표현 없이 식별함으로써, 표준 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성하며, 특히 레이블 노이즈와 낮은 편향-충돌 데이터 환경에서 뛰어난 성능을 보인다.

ABSTRACT

Neural networks trained with ERM (empirical risk minimization) sometimes learn unintended decision rules, in particular when their training data is biased, i.e., when training labels are strongly correlated with undesirable features. To prevent a network from learning such features, recent methods augment training data such that examples displaying spurious correlations (i.e., bias-aligned examples) become a minority, whereas the other, bias-conflicting examples become prevalent. However, these approaches are sometimes difficult to train and scale to real-world data because they rely on generative models or disentangled representations. We propose an alternative based on mixup, a popular augmentation that creates convex combinations of training examples. Our method, coined SelecMix, applies mixup to contradicting pairs of examples, defined as showing either (i) the same label but dissimilar biased features, or (ii) different labels but similar biased features. Identifying such pairs requires comparing examples with respect to unknown biased features. For this, we utilize an auxiliary contrastive model with the popular heuristic that biased features are learned preferentially during training. Experiments on standard benchmarks demonstrate the effectiveness of the method, in particular when label noise complicates the identification of bias-conflicting examples.

연구 동기 및 목표

  • 깊은 신경망이 편향된 훈련 데이터에서 부적절한 상관관계를 학습하는 문제를 해결하기 위해, 특히 강력한 특징이 부족한 경우에 대비한다.
  • 복잡한 생성 모델이나 분리된 표현에 의존하지 않고 효과적인 편향 충돌 샘플을 생성하는 데이터 증강 방법을 개발한다.
  • 모순 쌍을 사용하여 선택적으로 데이터 증강함으로써 분포 이탈과 레이블 노이즈 상황에서도 모델 일반화 성능을 향상시킨다.
  • 특히 편향 충돌 샘플이 부족한 경우에 표준 비편향 벤치마크에서 방법의 효과성을 검증한다.

제안 방법

  • SelecMix는 다음 두 가지 유형의 모순 쌍에 대해 mixup를 적용한다: (i) 동일한 레이블이지만 비편향 특징이 다를 경우, 또는 (ii) 다른 레이블이지만 비편향 특징이 유사한 경우.
  • 비편향 특징에 대한 의존도를 강화하기 위해 일반화된 감독 대비 손실(GSC 손실)을 사용하는 보조 대비 모델을 훈련시켜 이러한 쌍을 식별한다.
  • 보조 모델의 임bedding 공간을 활용해 비편향 특징의 유사도를 측정함으로써, 명시적인 편향 레이블 없이도 모순 쌍을 선별할 수 있다.
  • 선택적 mixup는 이러한 쌍에 대해 적용되며, λ가 min(λ, 1−λ)로 설정되어 선택된 샘플 쪽에 더 큰 영향을 주는 대칭 가중 전략을 사용한다.
  • 비편향 모델은 보조 모델과 함께 동시에 훈련되며, 증강된 데이터를 통해 강건성을 향상시킨다.
  • 이 방법은 비편향 특징이 충돌하는 기존 샘플을 자주 선택함으로써 암묵적으로 가중치를 조정함으로써, 명시적인 재가중 없이도 그 영향력을 높인다.

실험 결과

연구 질문

  • RQ1명시적인 편향 레이블이나 분리된 표현 없이도 mixup를 효과적으로 비편향 충돌 샘플 생성에 적용할 수 있는가?
  • RQ2모순 쌍 기반의 선택적 mixup 전략이 비편향 학습에서 표준 mixup 및 기타 데이터 증강 기반 기준 대비 어떻게 성능을 높이는가?
  • RQ3GSC 손실을 사용하는 보조 대비 모델이 비편향 특징 유사도 측정을 얼마나 향상시키는가?
  • RQ4레이블 노이즈가 존재할 경우, 비편향 충돌 샘플 탐지에 어려움을 줄 수 있는 상황에서 SelecMix의 성능은 얼마나 견고한가?
  • RQ5비편향 충돌 샘플이 훈련 데이터에 희귀할 경우에도 SelecMix는 우수한 성능을 유지하는가?

주요 결과

  • SelecMix는 표준 비편향 벤치마크에서 이전 방법들을 능가하며, 비bias 비율 0.5%인 Colored MNIST 데이터셋에서 70.80%의 정확도를 기록했고, 기존 mixup의 58.07%에 비해 뛰어난 성능을 보였다.
  • 비bias 비율 0.5%인 BFFHQ 데이터셋에서 SelecMix는 77.40%의 정확도를 달성했으며, LISA(58.93%)와 기존 mixup(56.20%)에 비해 뚜렷한 성능 향상을 보였다.
  • 레이블 노이즈가 존재하는 상황에서도 SelecMix는 뛰어난 성능 유지를 보이며, 다른 방법들이 성능 저하를 보이는 상황에서 강건성을 입증했다.
  • 절단 실험 결과, 선택적 mixup 전략과 GSC 손실 모두 필수적임을 확인했으며, 특히 GSC 손실이 비편향 특징 유사도 측정을 향상시켰다.
  • 비bias 비율 5%인 Corrupted CIFAR-10에서 SelecMix는 91.57%의 정확도를 기록했고, LISA(88.73%)와 기존 mixup(82.12%)를 모두 능가했다.
  • 모든 테스트된 데이터셋과 비bias 비율에서 일관된 성능 향상을 보였으며, 특히 비편향 충돌 샘플이 희귀한 경우에 효과적인 암묵적 가중치 조정이 이루어졌음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.