Skip to main content
QUICK REVIEW

[논문 리뷰] Extending the WILDS Benchmark for Unsupervised Adaptation

Shiori Sagawa, Pang Wei Koh|arXiv (Cornell University)|2021. 12. 09.
AI in cancer detection인용 수 12
한 줄 요약

이 논문은 실제 분포 이탈이 발생하는 다양한 도메인에 걸쳐 1450만 개의 정제된 비라벨 데이터 예제를 추가한 Wilds 2.0를 소개한다. 이는 히스토로지, 야생동물, 농업, 자연어처리를 포함한 여덟 가지 실제 데이터셋을 포함하며, 원래의 라벨이 부여된 분할 및 평가 프로토콜을 유지한다. 광범위한 비라벨 데이터가 제공됨에도 불구하고 최신의 비지도 학습 적응 방법들은 제한된 성능 향상을 보이며, 합성적이거나 스타일화된 도메인 이탈 외의 실제 분포 이탈에 대한 일반화의 어려움을 드러낸다.

ABSTRACT

Machine learning systems deployed in the wild are often trained on a source distribution but deployed on a different target distribution. Unlabeled data can be a powerful point of leverage for mitigating these distribution shifts, as it is frequently much more available than labeled data and can often be obtained from distributions beyond the source distribution as well. However, existing distribution shift benchmarks with unlabeled data do not reflect the breadth of scenarios that arise in real-world applications. In this work, we present the WILDS 2.0 update, which extends 8 of the 10 datasets in the WILDS benchmark of distribution shifts to include curated unlabeled data that would be realistically obtainable in deployment. These datasets span a wide range of applications (from histology to wildlife conservation), tasks (classification, regression, and detection), and modalities (photos, satellite images, microscope slides, text, molecular graphs). The update maintains consistency with the original WILDS benchmark by using identical labeled training, validation, and test sets, as well as the evaluation metrics. On these datasets, we systematically benchmark state-of-the-art methods that leverage unlabeled data, including domain-invariant, self-training, and self-supervised methods, and show that their success on WILDS is limited. To facilitate method development and evaluation, we provide an open-source package that automates data loading and contains all of the model architectures and methods used in this paper. Code and leaderboards are available at https://wilds.stanford.edu.

연구 동기 및 목표

  • 기존 벤치마크가 합성적이거나 스타일화된 분포 이탈에 집중하는 데 반해 실제 데이터 이탈에 대한 격차를 해소하기 위해.
  • 배포 환경에서 실제로 확보 가능한 비라벨 데이터를 통합함으로써 분포 이탈 벤치마크의 현실성과 실용성을 향상시키기 위해.
  • 정제된 비라벨 데이터를 활용하여 다양한 실제 분포 이탈에 대해 최신 비지도 적응 방법의 효과를 평가하기 위해.
  • 다양한 작업, 모odalities, 도메인을 아우르는 비지도 적응 방법의 훈련, 평가, 비교를 위한 표준화된 오픈소스 플랫폼을 제공하기 위해.

제안 방법

  • 원래 Wilds 10개 데이터셋 중 8개를 확장하여 소스, 타겟, 추가 도메인에서 유래한 정제된 비라벨 데이터를 추가하였으며, 동일한 라벨이 부여된 분할 및 평가 지표를 유지하였다.
  • Wilds 1.0과의 일관성을 유지하기 위해 동일한 라벨이 부여된 훈련, 검증, 테스트 세트를 재사용하여 실험 간 공정한 비교를 보장하였다.
  • 오픈소스 데이터 로더를 제공하고 기존 Wilds 라이브러리 API와의 통합을 통해 비라벨 데이터를 모델 훈련 및 평가에 원활하게 통합할 수 있도록 하였다.
  • 도메인 불변 훈련, 자기학습, 자기지도 학습과 같은 표준 비지도 적응 방법들을 확장된 데이터셋에 구현하고 평가하였다.
  • 각 데이터셋에 맞는 데이터 증강 및 배치 정규화 전략을 적용하였으며, 라벨이 부여된 배치와 비라벨 배치에 대해 별도의 정규화를 적용하였다.
  • 라벨이 부여된 데이터와 비라벨 데이터를 통합하여 완전히 라벨이 부여된 ERM 훈련을 시뮬레이션하는 실험을 통해 현재 방법의 한계를 규명하였다.

실험 결과

연구 질문

  • RQ1실제 분포 이탈과 현실적인 비라벨 데이터를 활용할 때 최신 비지도 적응 방법의 효과는 어떠한가?
  • RQ2소스, 타겟, 추가 도메인의 비라벨 데이터 포함 여부가 다양한 실제 작업에서 모델의 일반화 능력에 얼마나 기여하는가?
  • RQ3사진에서 스케치로의 이탈과 같은 합성적이거나 스타일화된 도메인 이탈에서 잘 작동하는 방법들이, 복잡하고 비선형적인 이탈을 보이는 실제 데이터 분포에 대해서도 일반화되는가?
  • RQ4대규모이고 현실적인 비라벨 데이터에 표준 자기지도 학습 또는 자기학습 접근법을 적용했을 때, 분포 외 일반화 성능이 크게 향상되는가?
  • RQ5비라벨 데이터의 규모와 분포(예: 타겟 도메인 대비 추가 도메인)가 모델 성능과 강건성에 어떻게 영향을 미치는가?

주요 결과

  • 최대 13배의 비라벨 데이터가 추가되었음에도 불구하고 최신 비지도 적응 방법들은 Wilds 2.0에서 제한된 성능 향상을 보이며, 실제 분포 이탈의 복잡성으로 인해 성능이 제한됨을 시사한다.
  • Amazon-wilds에서 라벨이 부여된 데이터와 비라벨 데이터를 통합한 완전한 라벨이 부여된 ERM 훈련은 평균 정확도 73.6% (±0.1)와 10번째 백분위수 정확도 56.4% (±0.8)를 기록하였으며, 이는 비라벨 데이터로부터의 약간의 성과 향상을 보여준다.
  • Amazon-wilds에서 추가 도메인의 비라벨 데이터(타겟 데이터 대비 10배 이상)를 사용했을 때 평균 정확도가 73.1%로 약간 낮게 나왔으며, 이는 단순히 데이터 양 증가만으로는 성능 향상이 어렵다는 것을 시사한다.
  • iWildCam2020-wilds에서 비라벨 추가 도메인 데이터(710,668개 예제)를 사용한 훈련은 수렴하기까지 두 배 이상의 에포크가 필요했으며, 이는 도메인 이탈과 데이터 이질성으로 인한 훈련 복잡도 증가를 나타낸다.
  • FMoW-wilds에서는 비라벨 타겟 도메인 데이터(173,208개 예제)를 사용했을 때 약간의 성능 향상이 있었지만, 어떤 방법도 표준 ERM를 크게 초월하지 못했으며, 이는 실제 환경에서의 적응이 여전히 어려움을 보여준다.
  • 결과적으로 현재 비지도 적응 방법들은 풍부한 비라벨 데이터가 있음에도 불구하고 실제 분포 이탈의 전반적인 스펙트럼에 대해 강건하지 않음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.