Skip to main content
QUICK REVIEW

[논문 리뷰] Leveraging Unlabeled Data to Predict Out-of-Distribution Performance

Saurabh Garg, Sivaraman Balakrishnan|arXiv (Cornell University)|2022. 01. 11.
Domain Adaptation and Few-Shot Learning인용 수 19
한 줄 요약

이 논문은 라벨이 부여된 소스 데이터와 레이블이 없는 타겟 데이터만을 사용하여 분포 외(out-of-distribution, OOD) 성능을 예측하는 평균 임계값 신뢰도(Average Thresholded Confidence, ATC)를 제안한다. ATC는 소스 검증 데이터에서 신뢰도 임계값을 설정하고, 이 임계값을 초과하는 타겟 예측의 비율을 기반으로 타겟 정확도를 추정한다. 이는 다양한 데이터셋과 분포 이탈 유형에서 기존 방법 대비 2–4배 낮은 추정 오차를 달성한다.

ABSTRACT

Real-world machine learning deployments are characterized by mismatches between the source (training) and target (test) distributions that may cause performance drops. In this work, we investigate methods for predicting the target domain accuracy using only labeled source data and unlabeled target data. We propose Average Thresholded Confidence (ATC), a practical method that learns a threshold on the model's confidence, predicting accuracy as the fraction of unlabeled examples for which model confidence exceeds that threshold. ATC outperforms previous methods across several model architectures, types of distribution shifts (e.g., due to synthetic corruptions, dataset reproduction, or novel subpopulations), and datasets (Wilds, ImageNet, Breeds, CIFAR, and MNIST). In our experiments, ATC estimates target performance $2$-$4 imes$ more accurately than prior methods. We also explore the theoretical foundations of the problem, proving that, in general, identifying the accuracy is just as hard as identifying the optimal predictor and thus, the efficacy of any method rests upon (perhaps unstated) assumptions on the nature of the shift. Finally, analyzing our method on some toy distributions, we provide insights concerning when it works. Code is available at https://github.com/saurabhgarg1996/ATC_code/.

연구 동기 및 목표

  • 라벨이 부여된 소스 데이터와 레이블이 없는 타겟 데이터만 제공될 때 분포 외(OOD) 테스트 데이터의 모델 정확도를 추정하는 것.
  • 실제 배포 환경에서 흔히 확보되지 않는 여러 타겟 도메인의 校정(calibration) 또는 레이블 데이터가 필요로 하지 않는 실용적인 방법을 개발하는 것.
  • 본질적인 분포 이탈이 존재하는 상황에서도 정확한 OOD 성능 추정이 이론적으로 가능한 조건을 규명하는 것.
  • 다양한 모델 아키텍처, 데이터셋(예: ImageNet, Wilds, CIFAR) 및 이탈 유형(합성, 부분집단, 자연적)에서 ATC를 실증적으로 평가하는 것.
  • OOD 정확도 추정의 어려움에 대한 이론적 통찰을 제공하며, 가정이 없이 최적의 예측자( predictor )를 식별하는 것과 비슷한 난이도를 보여주는 것.

제안 방법

  • ATC는 라벨가능한 소스 검증 데이터를 사용하여 모델 신뢰도(예: 최대 소프트맥스 확률 또는 음의 엔트로피)의 임계값을 학습한다.
  • 이 임계값은 소스 검증 예제 중 신뢰도가 이 임계값을 초과하는 비율이 모델의 소스 정확도와 일치하도록 선택된다.
  • 타겟 도메인 정확도는 레이블이 없는 타겟 예제 중에서 이 학습된 임계값을 초과하는 신뢰도를 가진 예제의 비율로 추정된다.
  • 이 방법은 타겟 데이터에 대한 추가 校정 또는 회귀 분석을 사용하지 않으며, 사전 학습된 모델의 신뢰도 점수에만 의존한다.
  • ATC는 타겟 데이터에 대한 보정이 없는 경우와 온전한 온라인 온도 스케일링(Temperature Scaling, TS) 보정을 적용한 경우를 모두 평가하여 강건성(robustness)을 점검한다.
  • 이 방법은 ResNet, DenseNet, DistilBERT 등의 시각 및 언어 모델에 적용되며, ImageNet, Wilds, BREEDS, CIFAR, MNIST 등의 데이터셋에서 평가된다.

실험 결과

연구 질문

  • RQ1라벨가능한 소스 데이터와 레이블이 없는 타겟 데이터만을 사용할 때 어떤 조건에서 OOD 성능을 정확히 예측할 수 있는가?
  • RQ2여러 타겟 도메인의 校정 또는 레이블 데이터가 필요한 기존 방법과 비교해 ATC는 어떻게 성능을 내는가?
  • RQ3더 복잡한 회귀 기반 또는 校정 기반 접근 방식보다 단순한 신뢰도 임계값 설정 방법이 더 우수한 성능을 낼 수 있는가?
  • RQ4OOD 정확도 추정의 이론적 한계는 무엇이며, 이탈 유형에 대한 가정이 이에 어떻게 影향을 미치는가?
  • RQ5ATC는 합성 오염, 새로운 부분집단, 자연적 분포 이탈을 포함한 다양한 이탈 유형에 일반화되는가?

주요 결과

  • 모든 평가된 데이터셋과 이탈 유형에서 ATC는 기존 방법 대비 평균 절대 추정 오차를 2–4배 감소시킨다.
  • ImageNet 자연적 이탈에서 ATC는 평균 절대 오차(MAE)가 0.73을 기록하여 다음으로 우수한 방법인 DOC의 2.22를 뛰어넘는다.
  • 새로운 부분집단을 포함하는 FMoW-Wilds 데이터셋에서 ATC는 MAE 9.94를 기록하며, DOC(13.24) 및 기타 기준선보다 유의미하게 낮다.
  • ATC는 타겟 도메인에 대한 校정이 없더라도 강력한 성능을 유지한다. 반면, 校정이 필요한 방법들은 새로운 분포에서 자주 실패한다.
  • 제거 실험에서, ATC는 강력한 선형 모델을 피팅하여 성능을 향상시킨 DOC와 비교해도 여전히 우수한 성능을 보였다.
  • ATC는 모델 아키텍처(ResNet, DenseNet, FCN, DistilBERT)와 데이터셋(시각 및 언어)을 초월해 일반화되며, 광범위한 실용적 유용성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.