[논문 리뷰] Out-of-Distribution Generalization Analysis via Influence Function
이 논문은 관측된 도메인에서의 테스트 정확도에 의존하는 것의 한계를 해결하기 위해, 분포 이탈(OOD) 일반화 성능을 평가하기 위해 영향 함수의 분산을 메트릭으로 사용하는 것을 제안한다. 이 메트릭은 진정한 OOD 분포가 알려지지 않았거나 관측되지 않았을 때 기존 방법들인 IRM 페널티와 비교해 진정한 OOD 정확도와 더 잘 상관됨을 보여준다.
The mismatch between training and target data is one major challenge for current machine learning systems. When training data is collected from multiple domains and the target domains include all training domains and other new domains, we are facing an Out-of-Distribution (OOD) generalization problem that aims to find a model with the best OOD accuracy. One of the definitions of OOD accuracy is worst-domain accuracy. In general, the set of target domains is unknown, and the worst over target domains may be unseen when the number of observed domains is limited. In this paper, we show that the worst accuracy over the observed domains may dramatically fail to identify the OOD accuracy. To this end, we introduce Influence Function, a classical tool from robust statistics, into the OOD generalization problem and suggest the variance of influence function to monitor the stability of a model on training domains. We show that the accuracy on test domains and the proposed index together can help us discern whether OOD algorithms are needed and whether a model achieves good OOD generalization.
연구 동기 및 목표
- 관측된 도메인에서의 테스트 정확도를 OOD 일반화의 대체 지표로 사용하는 데서 비롯하는 심각한 한계를 해결하기 위해, 진정한 OOD 분포가 관측되지 않았을 경우에 잘못된 해석을 유도할 수 있음을 다루는 것.
- 모든 목표 도메인의 집합이 알려지지 않은 상태에서도 OOD 알고리즘이 필요한지 여부를 신뢰할 수 있게 나타내는 모델에 종속되지 않는 메트릭을 개발하는 것.
- 하이퍼파라미터 튜닝에 영향을 받지 않는 안정적이고 해석 가능하며 비교 가능한 모델 내성 측정 방법을 제공하는 것.
- IRM 페널티가 선택 메트릭으로서의 한계를 극복하기 위해, 과적합으로 인해 페널티 항목에 과도하게 적응함으로써 실제 OOD 성능과 상관관계가 없을 수 있는 문제를 해결하는 것.
제안 방법
- 다양한 도메인에서 모델 예측이 훈련 데이터 포인트에 얼마나 민감한지를 측정하기 위해 복원 통계에서 유래한 영향 함수를 도입한다.
- 훈련 도메인 전반에 걸친 영향 함수의 분산을 계산하여 안정성 메트릭으로 사용하며, 이를 $\mathcal{V}_{{\bm{\gamma}}|{\bm{\theta}}}$로 표기하여 분포 이탈 상황에서의 모델 일관성 평가를 수행한다.
- 분산 메트릭을 정규화하기 위해 샤프링 기반 기준선을 사용하여 절대 척도의 해석 없이도 다양한 모델과 알고리즘 간의 상대적 비교가 가능하도록 한다.
- 두 단계 평가 프로토콜을 제안한다: 첫 번째로 영향 함수 분산을 통해 OOD 일반화가 필요한지 판단하고, 두 번째로 동일한 OOD 카테고리 내에서의 테스트 정확도를 사용해 모델을 순위 매긴다.
- 실세계 벤치마크인 Colored MNIST, VLCS, PACS에 대해 ERM, IRM, Mixup, gDRO와 비교하여 메트릭을 적용한다.
- 낮은 영향 함수 분산이 진정한 OOD 정확도와 강하게 상관됨을 입증하며, 이는 테스트 정확도가 이를 예측하지 못할 때에도 성립한다.
실험 결과
연구 질문
- RQ1관측된 도메인에서의 테스트 정확도는 모델의 진정한 OOD 일반화 성능을 신뢰할 수 있는 지표로 작용할 수 있는가?
- RQ2모든 목표 도메인의 집합이 알려지지 않은 상태에서도 OOD 일반화가 필요한지 탐지할 수 있는 모델에 종속되지 않는 메트릭이 존재하는가?
- RQ3영향 함수의 분산은 IRM 페널티에 비해 OOD 내성 예측에 얼마나 효과적인가?
- RQ4영향 함수 분산은 검증되지 않은 도메인으로의 일반화가 잘 되는 모델과 훈련 도메인에 과적합된 모델을 구분하는 데 도움이 되는가?
- RQ5제안된 메트릭은 하이퍼파라미터가 최적화되지 않은 상태에서도 다양한 알고리즘과 데이터셋에서 효과를 유지하는가?
주요 결과
- Colored MNIST에서 ERM이 테스트 도메인에서는 IRM을 앞서지만, IRM이 훨씬 높은 OOD 정확도를 달성함으로써 관측된 도메인에서의 테스트 정확도가 OOD 정확도의 나쁜 대체 지표가 될 수 있음을 보여준다.
- 영향 함수 분산 메트릭 $\mathcal{V}_{{\bm{\gamma}}|{\bm{\theta}}}$는 여러 데이터셋과 알고리즘 간에 일관되게 OOD 성능과 상관관계가 있으며, 낮은 값일수록 더 좋은 OOD 일반화를 의미한다.
- VLCS에서 gDRO는 평균 5.17의 영향 함수 분산을 보이며 안정성이 떨어짐을 나타내며, ERM과 Mixup는 각각 2.05와 2.70의 낮은 값을 보이며 이는 그들의 더 나은 OOD 성능과 일치한다.
- IRM 페널티는 선택 메트릭으로서 부적절한데, OOD 성능이 열악한 경우에도 낮을 수 있기 때문이다 (예: C 도메인에서 IRM 페널티는 2.59e-4이지만 OOD 정확도는 38.64%에 불과함). 또한 ERM과 유사한 OOD 정확도를 보이는 Mixup에 대해서도 높은 페널티를 기록함으로써 실제 성능과의 상관관계가 떨어진다.
- 제안된 메트릭은 페널티 척도의 영향을 받지 않으며 다양한 알고리즘에 대해 강건하기 때문에, 하이퍼파라미터 튜닝에 의존하지 않고도 신뢰할 수 있는 모델 선택이 가능하다.
- When $\mathcal{E}_{all} \setminus \mathcal{E}_{tr} = \{S\}$일 때, gDRO의 샤프링된 $\mathcal{V}_{{\bm{\gamma}}|{\bm{\theta}}}$는 표준 버전보다 유의미하게 작으며, 이는 더 적은 불변 특징을 포착하고 있음을 시사한다. 반면 ERM과 Mixup는 최소한의 차이를 보이며 더 높은 안정성을 나타낸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.