Skip to main content
QUICK REVIEW

[논문 리뷰] ID and OOD Performance Are Sometimes Inversely Correlated on Real-world Datasets

Damien Teney, Lin, Yong|arXiv (Cornell University)|2022. 09. 01.
Machine Learning and Data Classification인용 수 7
한 줄 요약

이 논문은 실제 데이터셋에서 내분포(ID) 성능과 외분포(OOD) 성능 간에 역상관 관계가 존재할 수 있음을 입증한다—기존의 양의 상관관계를 가정하는 것과 도전적이다. 경험적 분석과 이론적 모델링을 통해, 단지 ID 성능을 최적화하는 모델은 특히 허수적 특징이 학습 분포를 지배할 경우 OOD 일반화에서 성능이 떨어질 수 있음을 보여준다.

ABSTRACT

Several studies have compared the in-distribution (ID) and out-of-distribution (OOD) performance of models in computer vision and NLP. They report a frequent positive correlation and some surprisingly never even observe an inverse correlation indicative of a necessary trade-off. The possibility of inverse patterns is important to determine whether ID performance can serve as a proxy for OOD generalization capabilities. This paper shows with multiple datasets that inverse correlations between ID and OOD performance do happen in real-world data - not only in theoretical worst-case settings. We also explain theoretically how these cases can arise even in a minimal linear setting, and why past studies could miss such cases due to a biased selection of models. Our observations lead to recommendations that contradict those found in much of the current literature. - High OOD performance sometimes requires trading off ID performance. - Focusing on ID performance alone may not lead to optimal OOD performance. It may produce diminishing (eventually negative) returns in OOD performance. - In these cases, studies on OOD generalization that use ID performance for model selection (a common recommended practice) will necessarily miss the best-performing models, making these studies blind to a whole range of phenomena.

연구 동기 및 목표

  • 실제 데이터셋에서 ID와 OOD 성능 간의 역상관 관계가 발생하는지, 이는 이전 가정과 반대되는지를 조사하기 위해.
  • 이전 연구들이 편향된 모델 선택으로 인해 이러한 역상관 패턴을 체계적으로 간과했을 수 있는 이유를 설명하기 위해.
  • 역상관 관계가 모델 부적합성과 허수적 특징 의존성에서 기인한다는 이론적 및 경험적 증거를 제공하기 위해.
  • 모델 선택 시 ID 성능을 OOD 일반화의 대체 지표로 사용하는 광범위한 관행을 도전하기 위해.
  • ID와 OOD 성능 간 잠재적 트레이드오프를 고려한 OOD 일반화 연구를 위한 개선된 방법론을 제안하기 위해.

제안 방법

  • 실제 데이터셋, 특히 OOD 벤치마킹 문헌에서 유래한 Camelyon17 및 기타 데이터셋을 대상으로 ID 및 OOD 성능를 경험적으로 평가하였다.
  • 학습의 최적화 경로에 따른 성능 변동성을 평가하기 위해 다양한 에포크 수와 랜덤 시드로 모델을 훈련시켰다.
  • 해결책 공간의 다양성을 유도하는 정규화를 ERM 목표에 적용하여 더 넓은 범위의 모델 솔루션을 생성하고, 역상관 관계를 드러내었다.
  • 최소한의 이론적 선형 모델을 구성하여, 강건한 특징과 허수적 특징이 동시에 존재할 경우 역상관 관계가 어떻게 발생하는지 보여주었다.
  • 분포 이탈의 크기가 ID/OOD 성능 패턴에 미치는 영향을 분석하여, 특정 이탈 조건에서만 역상관 관계가 나타남을 보여주었다.
  • 기존 OOD 벤치마킹 관행의 한계를 평가하였으며, 특히 ID 성능이 열악한 모델를 기각하는 관행이 주요 문제임을 지적하였다.

실험 결과

연구 질문

  • RQ1이론적 최악의 시나리오를 초월하여 실제 데이터셋에서 ID와 OOD 성능 간의 역상관 관계를 관찰할 수 있는가?
  • RQ2이론적으로 가능성이 있음에도 불구하고 이전 연구들이 왜 역상관 관계를 관찰하지 못했는가?
  • RQ3특히 모델 부적합성이라는 구체적 메커니즘이 ID/OOD 성능 패턴의 발생을 어떻게 설명하는가?
  • RQ4분포 이탈의 크기가 다양할 경우 ID와 OOD 성능 간의 관계에 어떤 영향을 미치는가?
  • RQ5상위 ID 성능 모델만 선택하는 일반적인 OOD 벤치마킹 관행이 최적의 OOD 성능 모델 탐지에 얼마나 심각하게 영향을 미치는가?

주요 결과

  • Camelyon17와 부록에서 분석한 5개 데이터셋 중 4개에서 ID와 OOD 성능 간의 역상관 관계가 경험적으로 관찰되었다.
  • 다양성 유도 정규화를 적용하여 훈련한 모델에서 역상관 관계가 더 두드러졌는데, 이는 해결책 공간 탐색이 숨겨진 트레이드오프를 드러내기 때문임을 시사한다.
  • 이론적 분석 결과, 강건한 특징과 허수적 특징이 동시에 존재할 경우 ERM 목표가 OOD 일반화를 희생하면서까지 허수적 특징을 선호함으로써 역상관 관계가 발생한다.
  • 이전 연구들은 ID 성능이 열악한 모델를 기각함으로써 편향된 모델 선택을 하였기 때문에, 역상관 관계를 간과했을 가능성이 있다—이는 잠재적으로 높은 OOD 성능을 보일 수 있는 모델들이 제외되었을 수 있음을 의미한다.
  • 이 연구는 ID 성능에만 집중함으로써 모델 선택을 할 경우 OOD 성능 향상이 둔화되거나 심지어 악화될 수 있음을 입증한다.
  • 강력한 허수적 상관관계가 존재하는 환경에서는 ID 성능을 OOD 일반화의 신뢰할 수 있는 대체 지표로 간주하는 문헌의 일반적 권고를 무효화한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.