[논문 리뷰] Correct-N-Contrast: A Contrastive Approach for Improving Robustness to Spurious Correlations
이 논문은 임의의 허위 상관관계나 그룹 레이블 없이도 허위 상관관계에 대한 강건성을 향상시키는 대trastive learning 방법인 Correct-n-Contrast (CnC)을 제안한다. 사전 훈련된 ERM 모델의 예측을 활용하여 동일한 클래스이지만 다른 허위 특징을 가진 샘플을 식별함으로써, CnC는 이러한 샘플의 표현을 정렬하고, 이질적 클래스이지만 동일한 허위 특징을 가진 쌍은 분리함으로써, 벤치마크에서 최고 수준의 악성 그룹 정확도를 달성하며 평균 절대 상승률 3.6%를 기록한다.
Spurious correlations pose a major challenge for robust machine learning. Models trained with empirical risk minimization (ERM) may learn to rely on correlations between class labels and spurious attributes, leading to poor performance on data groups without these correlations. This is particularly challenging to address when spurious attribute labels are unavailable. To improve worst-group performance on spuriously correlated data without training attribute labels, we propose Correct-N-Contrast (CNC), a contrastive approach to directly learn representations robust to spurious correlations. As ERM models can be good spurious attribute predictors, CNC works by (1) using a trained ERM model's outputs to identify samples with the same class but dissimilar spurious features, and (2) training a robust model with contrastive learning to learn similar representations for same-class samples. To support CNC, we introduce new connections between worst-group error and a representation alignment loss that CNC aims to minimize. We empirically observe that worst-group error closely tracks with alignment loss, and prove that the alignment loss over a class helps upper-bound the class's worst-group vs. average error gap. On popular benchmarks, CNC reduces alignment loss drastically, and achieves state-of-the-art worst-group accuracy by 3.6% average absolute lift. CNC is also competitive with oracle methods that require group labels.
연구 동기 및 목표
- 허위 특성 또는 그룹 식별 정보가 없는 환경에서 머신러닝 모델의 악성 그룹 일반화 성능을 향상시키는 것.
- 기존 방법들이 오라클 그룹 레이블에 의존하거나 표현 정렬을 직접 최적화하지 못하는 한계를 해결하는 것.
- 모델이 허위 특성보다 클래스 구분 특징에 의존하도록 명시적으로 장려하는 대비 학습 프레임워크를 개발하는 것.
- 대부분의 표현 정렬이 악성 그룹 오차 감소와 이론적·실증적으로 연결됨을 보여주며, 강건성에 대한 새로운 최적화 목표를 제시하는 것.
제안 방법
- 사전 훈련된 ERM 모델을 훈련하여 클래스 레이블을 예측하고, 그 출력을 통해 간접적으로 허위 특성 패턴을 추론한다.
- ERM 모델의 예측을 사용하여 하드 퍼지티브(positive) 샘플을 추출한다: 동일한 클래스이지만 다른 예측을 가진 샘플로 표현 정렬을 촉진한다.
- 하드 네거티브(negative) 샘플을 사용한다: 다른 클래스이지만 동일한 ERM 예측을 가진 샘플로 표현 공간 내의 이질적 클래스 간 분리를 강제한다.
- 모멘터럼 인코더를 사용한 대비 학습을 적용하여 내부 클래스 정렬과 이질적 클래스 간 분리를 동시에 최적화한다.
- 모호하거나 허위 상관관계가 강한 케이스를 우선순위로 삼는 새로운 샘플링 전략을 도입하여 강건성을 향상시킨다.
- 각 클래스별 악성 그룹 오차와 평균 오차 간 격차를 상한으로 제약하는 표현 정렬 손실을 최소화한다.
실험 결과
연구 질문
- RQ1표현 공간에서 동일한 클래스이지만 다른 허위 특징을 가진 샘플 간의 유사도로 측정되는 표현 정렬이 악성 그룹 오차 감소의 대체 지표로 사용될 수 있는가?
- RQ2ERM 모델의 예측을 활용해 하드 퍼지티브 및 네거티브를 정의하는 대비 학습 접근법이 허위 특성 레이블이 없이도 강건성을 향상시키는가?
- RQ3정렬 손실은 악성 그룹 일반화와 어떻게 관련되어 있으며, 이를 통해 악성 그룹 오차와 평균 오차 간 격차를 상한으로 제약할 수 있는가?
- RQ4강력한 허위 상관관계를 가진 벤치마크에서 CnC는 기존의 사전 학습 및 그룹 무관 강건 학습 방법보다 악성 그룹 정확도에서 승리할 수 있는가?
주요 결과
- CnC는 평가된 모든 벤치마크에서 정렬 손실을 상당한 폭으로 감소시켜 표현의 강건성 향상을 시사한다.
- 악성 그룹 오차는 정렬 손실과 밀접하게 추적되며, 제안된 표현 정렬과 강건성 간의 관계를 검증한다.
- CnC는 표준 벤치마크에서 ERM 및 최고 수준의 기준 모델 대비 평균 절대 상승률 3.6%를 기록하며 악성 그룹 정확도를 향상시킨다.
- 몇 가지 설정에서 그룹 레이블이 필요한 오라클 방법보다 CnC가 승리함으로써, 허위 특성에 대한 감독 없이도 효과적임을 입증한다.
- UMAP 시각화 결과 CnC 표현은 허위 특성과는 무관하게 클래스 레이블에만 의존하는 것으로 나타났으며, ERM 및 Jtt와는 대조된다.
- GradCAM 시각화 결과 CnC 모델은 주로 클래스 관련 특징(예: 새 몸통, 머리카락)에 주목하는 반면, ERM 모델은 허위 배경이나 특성에 집중하는 것으로 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.