Skip to main content
QUICK REVIEW

[論文レビュー] Extending the WILDS Benchmark for Unsupervised Adaptation

Shiori Sagawa, Pang Wei Koh|arXiv (Cornell University)|Dec 9, 2021
AI in cancer detection被引用数 12
ひとこと要約

この論文は、ヒストグラム、野生動植物、農業、NLPをカバーする8つの多様な現実世界のデータセットにわたり、1450万件の収集済みラベルなし例を追加したWildsベンチマークの拡張版であるWilds 2.0を紹介する。元のラベル付き分割と評価プロトコルを維持している。膨大なラベルなしデータが利用可能であるにもかかわらず、最先端の非教師あり適応手法は限定的な改善を示し、合成的または装飾的なドメインシフトを超える現実的な分布シフトにおける一般化の難しさを浮き彫りにしている。

ABSTRACT

Machine learning systems deployed in the wild are often trained on a source distribution but deployed on a different target distribution. Unlabeled data can be a powerful point of leverage for mitigating these distribution shifts, as it is frequently much more available than labeled data and can often be obtained from distributions beyond the source distribution as well. However, existing distribution shift benchmarks with unlabeled data do not reflect the breadth of scenarios that arise in real-world applications. In this work, we present the WILDS 2.0 update, which extends 8 of the 10 datasets in the WILDS benchmark of distribution shifts to include curated unlabeled data that would be realistically obtainable in deployment. These datasets span a wide range of applications (from histology to wildlife conservation), tasks (classification, regression, and detection), and modalities (photos, satellite images, microscope slides, text, molecular graphs). The update maintains consistency with the original WILDS benchmark by using identical labeled training, validation, and test sets, as well as the evaluation metrics. On these datasets, we systematically benchmark state-of-the-art methods that leverage unlabeled data, including domain-invariant, self-training, and self-supervised methods, and show that their success on WILDS is limited. To facilitate method development and evaluation, we provide an open-source package that automates data loading and contains all of the model architectures and methods used in this paper. Code and leaderboards are available at https://wilds.stanford.edu.

研究の動機と目的

  • 合成的または装飾的な分布シフトに焦点を当てた既存のベンチマークが現実世界のデータシフトをカバーしていないというギャップを埋める。
  • 実際の展開状況で実際に入手可能なラベルなしデータを統合することで、分布シフトベンチマークの現実性と実用的価値を向上させる。
  • 収集済みラベルなしデータを用いて、より広範な現実世界の分布シフトにおける最先端の非教師あり適応手法の有効性を評価する。
  • 多様なタスク、モodalitiy、ドメインをカバーする標準化されたオープンソースプラットフォームを提供し、非教師あり適応手法のトレーニング、評価、比較を可能にする。

提案手法

  • 元のWildsの10データセットのうち8つを、ソース、ターゲット、および追加ドメインからの収集済みラベルなしデータで拡張し、同じラベル付き分割と評価メトリクスを維持した。
  • Wilds 1.0と一貫性を保つために、同じラベル付きトレーニング、バリデーション、テストセットを再利用し、実験間の公平な比較を確保した。
  • オープンソースのデータローダーを提供し、既存のWildsライブラリAPIとの統合を実装することで、モデルトレーニングおよび評価におけるラベルなしデータのシームレスな利用を支援した。
  • ドメイン不変トレーニング、自己学習、自己教師付き学習を含む標準的な非教師あり適応手法を、拡張されたデータセット上で実装および評価した。
  • 各データセットに適したデータオーグメンテーションおよびバッチ正規化戦略を採用し、ラベル付きバッチとラベルなしバッチで別々の正規化を実施した。
  • ラベル付きデータとラベルなしデータを統合して完全ラベル付きERMトレーニングをシミュレートすることで、アブレーションスタディを実施し、現在の手法の限界を明らかにした。

実験結果

リサーチクエスチョン

  • RQ1現実世界の分布シフトに現実的なラベルなしデータを用いて適用した場合、最先端の非教師あり適応手法はどの程度有効であるか?
  • RQ2ソース、ターゲット、および追加ドメインからのラベルなしデータの統合は、多様な現実世界のタスクにおけるモデルの一般化をどの程度向上させるか?
  • RQ3合成的または装飾的なドメインシフト(例:写真からスケッチ)でうまく機能する手法は、複雑で非線形なシフトを示す現実世界のデータ分布に対しても一般化可能か?
  • RQ4大規模で現実的なラベルなしデータに標準的な自己教師付きまたは自己学習アプローチを適用することで、分布外一般化性能が著しく向上するか?
  • RQ5ラベルなしデータのスケールと分布(例:ターゲットドメイン対追加ドメイン)は、モデルのパフォーマンスと耐性にどのように影響するか?

主な発見

  • 最大で13倍のラベルなしデータを追加しても、最先端の非教師あり適応手法はWilds 2.0で限定的な改善を示し、現実世界の分布シフトの複雑さによってその性能が制限されていることが示された。
  • Amazon-wildsでは、ラベル付きおよびラベルなしデータを統合した完全ラベル付きERMトレーニングで平均正解率73.6%(±0.1)および10百分位正解率56.4%(±0.8)を達成し、ラベルなしデータによるわずかな向上が確認された。
  • Amazon-wildsで追加ドメインのラベルなしデータ(ターゲットデータの10倍の例数)を用いた場合、平均正解率73.1%にとどまり、わずかに低い性能にとどまった。これは、データ量そのものが改善に十分でないことを示唆している。
  • iWildCam2020-wildsでは、ラベルなし追加ドメインデータ(710,668例)を用いたトレーニングで収束に2倍のエポック数を要した。これは、ドメインシフトとデータの異質性によるトレーニングの複雑さの増加を示している。
  • FMoW-wildsでは、ラベルなしターゲットデータ(173,208例)を用いた場合、わずかな向上が見られたが、どの手法でも標準的なERMを大幅に上回る改善は得られず、現実世界の適応の難しさが浮き彫りになった。
  • これらの結果から、豊富なラベルなしデータが用意されていても、現在の非教師あり適応手法は現実世界の分布シフトの全範囲に対しては頑健ではないことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。