[논문 리뷰] Out-of-distribution Generalization in the Presence of Nuisance-Induced Spurious Correlations
이 논문은 흐름성 불균형에 기인한 인위적 상관관계에 강인한 표현을 학습함으로써 분포 외 일반화를 향상시키기 위해 Nuisance-Randomized Distillation (NuRD)를 제안한다. NuRD는 먼저 흐름성-라벨 의존성을 무작위화하여 흐름성 무작위 분포를 생성한 후, 이 분포 하에서 라벨 정보를 최대화하는 표현을 디스틸레이션함으로써, 다양한 흐름성-라벨 관계에서 안정적인 성능을 확보한다. 이는 흉부 X선 폐렴 분류 및 물새 인식 작업에서 강력한 경험적 성과를 거두었다.
In many prediction problems, spurious correlations are induced by a changing relationship between the label and a nuisance variable that is also correlated with the covariates. For example, in classifying animals in natural images, the background, which is a nuisance, can predict the type of animal. This nuisance-label relationship does not always hold, and the performance of a model trained under one such relationship may be poor on data with a different nuisance-label relationship. To build predictive models that perform well regardless of the nuisance-label relationship, we develop Nuisance-Randomized Distillation (NURD). We introduce the nuisance-randomized distribution, a distribution where the nuisance and the label are independent. Under this distribution, we define the set of representations such that conditioning on any member, the nuisance and the label remain independent. We prove that the representations in this set always perform better than chance, while representations outside of this set may not. NURD finds a representation from this set that is most informative of the label under the nuisance-randomized distribution, and we prove that this representation achieves the highest performance regardless of the nuisance-label relationship. We evaluate NURD on several tasks including chest X-ray classification where, using non-lung patches as the nuisance, NURD produces models that predict pneumonia under strong spurious correlations.
연구 동기 및 목표
- 분포 간 흐름성 변수와 라벨 간의 관계가 변화함에 따라 발생하는 분포 외 일반화 성능 저하 문제를 해결하기 위해.
- 시험 분포에서 흐름성과 라벨 간 상관관계가 어떻게 변하든 예측 모델이 높은 성능을 유지할 수 있도록 보장하기 위해.
- 흐름성과 라벨이 서로 독립이 되는 분포인 '흐름성 무작위 분포'를 정식화하여, 변화하는 흐름성-라벨 의존성에 강인한 표현을 식별할 수 있도록 하기 위해.
- 조건부 독립성(라벨과 흐름성이 표현 조건 하에서 조건부 독립)을 만족하는 표현 집합인 '비상관 집합' 내에서의 표현이 항상 근사 예측보다 최소한 동일하거나 더 나은 성능을 보임을 증명하고, 최적의 표현을 식별하기 위해.
- 의료 영상 및 이미지 분류 작업에서 강한 인위적 상관관계가 존재하는 경우에 NuRD의 경험적 검증을 수행하기 위해.
제안 방법
- 흐름성 변수가 라벨와 통계적으로 독립이 되도록 하여 인위적 의존성을 분리하는 흐름성 무작위 분포를 도입한다.
- 흐름성 무작위 분포 하에서 라벨와 흐름성이 조건부 독립이 되는 표현의 집합을 '비상관 집합'으로 정의한다.
- 두 단계로 구성된 NuRD를 제안한다: 첫째, 생성 모델 또는 재가중 기반으로 흐름성을 무작위화하여 흐름성과 라벨이 독립이 되는 데이터를 생성한다; 둘째, 비상관 집합 내에서 라벨과의 상호정보량을 최대화하는 표현을 디스틸레이션한다.
- 표현, 흐름성, 라벨 간의 공동 의존성을 억제하는 정규화된 학습 목표를 사용하며, 정보 획득과 독립성 강화 사이의 균형을 조절하기 위해 하이퍼파rameter λ를 사용한다.
- 흐름성 값의 역확률을 추정하여 재가중 기반 흐름성 무작위화를 적용함으로써, 흐름성 무작위 분포를 근사한다.
- 학생 모델을 훈련시켜 디스틸레이션된 표현만을 사용하여 라벨를 예측함으로써, 다양한 흐름성-라벨 관계를 가진 분포 가족에서 일반화 성능이 유지되도록 보장한다.
실험 결과
연구 질문
- RQ1흐름성 변화 가족 내 모든 분포에서 성능이 우수한 표현을 구성할 수 있는가? 특히 흐름성-라벨 관계가 변화하는 경우에도 말이다.
- RQ2흐름성 무작위 분포 하에서 표현을 학습하는 것이 기존의 경험적 리스크 최소화(Empirical Risk Minimization, ERM)보다 분포 외 성능을 더 잘 보장하는가?
- RQ3흐름성 무작위 분포 하에서 조건부 독립성(표현 조건 하에서 라벨와 흐름성이 조건부 독립)을 만족하면서도 라벨에 대해 최대한 정보를 담고 있는 표현을 식별할 수 있는가?
- RQ4의료 영상이나 동물 분류와 같은 강한 흐름성 유도 인위적 상관관계가 존재하는 설정에서 NuRD는 표준 ERM보다 어떻게 비교되는가?
- RQ5최적화가 안정되고 성능이 강인하게 유지되도록 하기 위해 어떤 하이퍼파rameter 설정(예: λ)이 필요한가?
주요 결과
- 물새 분류 작업에서, NuRD는 56픽셀의 테두리를 흐름성으로 사용하여 81%의 테스트 정확도를 달성하였으며, ERM의 66%보다 뚜렷이 높았다.
- 흉부 X선 폐렴 분류 작업에서는, 병원별 영상 촬영 프로토콜에 기인한 강한 인위적 상관관계가 존재하는 상황에서도 NuRD가 높은 성능을 유지하는 모델을 생성하였다.
- 훈련 데이터에서의 분포와 점점 더 다를수록(ρ = 0.5, 0.7, 0.9) 테스트한 결과, NuRD는 안정적인 성능을 유지한 반면, ERM의 정확도는 흐름성-라벨 관계 변화에 따라 급격히 감소하였다.
- λ = 5로 설정(기본값 λ = 1보다 높음)한 경우, 물새 분류에서 평균 76%의 테스트 정확도와 클래스 조건부 가우시안 분포에서 61%의 정확도를 기록하였다. 그러나 일부 실험이 최적화 불안정성으로 인해 실패하여 λ 조정에 민감함을 보였다.
- 흐름성 유도 인위적 상관관계가 없는 상황(일정한 흐름성)에서는 NuRD와 ERM의 성능이 거의 동일했으며(88% 대 89%), 이는 NuRD가 인위적 상관관계가 존재하지 않을 경우 성능 저하가 발생하지 않음을 검증한다.
- 최적화가 안정된 경우에만 디스틸레이션 손실과 검증 성능가 근사 예측과 유의미하게 떨어져 있었으며, 이는 정규화 강도와 모델 성능 사이의 상충 관계를 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.