[論文レビュー] Leveraging Unlabeled Data to Predict Out-of-Distribution Performance
本稿では、ラベル付きソースデータとラベルなしターゲットデータのみを用いて、分布外(OOD)性能を予測する手法であるAverage Thresholded Confidence(ATC)を提案する。ATCは、ソース検証データ上で信頼度のしきい値を設定し、そのしきい値を超えるターゲット例の割合としてターゲットの精度を推定する。この手法により、多様なデータセットおよびシフトタイプにおいて、先行手法と比較して2–4倍低い推定誤差を達成した。
Real-world machine learning deployments are characterized by mismatches between the source (training) and target (test) distributions that may cause performance drops. In this work, we investigate methods for predicting the target domain accuracy using only labeled source data and unlabeled target data. We propose Average Thresholded Confidence (ATC), a practical method that learns a threshold on the model's confidence, predicting accuracy as the fraction of unlabeled examples for which model confidence exceeds that threshold. ATC outperforms previous methods across several model architectures, types of distribution shifts (e.g., due to synthetic corruptions, dataset reproduction, or novel subpopulations), and datasets (Wilds, ImageNet, Breeds, CIFAR, and MNIST). In our experiments, ATC estimates target performance $2$-$4 imes$ more accurately than prior methods. We also explore the theoretical foundations of the problem, proving that, in general, identifying the accuracy is just as hard as identifying the optimal predictor and thus, the efficacy of any method rests upon (perhaps unstated) assumptions on the nature of the shift. Finally, analyzing our method on some toy distributions, we provide insights concerning when it works. Code is available at https://github.com/saurabhgarg1996/ATC_code/.
研究の動機と目的
- ラベル付きソースデータとラベルなしターゲットデータのみが利用可能な状況で、分布外(OOD)テストデータにおけるモデル精度を推定すること。
- 実世界の展開においてしばしば入手不可能な複数のターゲットドメインからのラベル付きデータやキャリブレーションを回避する実用的な手法を開発すること。
- 固有の分布シフトが存在する中で、理論的に正確なOOD性能推定が可能な条件を同定すること。
- 多様なモデルアーキテクチャ、データセット(例:ImageNet、Wilds、CIFAR)およびシフトタイプ(合成的、サブポピュレーション、自然)においてATCを実験的に評価すること。
- OOD精度推定の難易度について理論的洞察を提供し、仮定なしで最適な予測子を同定することと同等の難易度であることを示すこと。
提案手法
- ATCは、ラベル付きソース検証データを用いて、モデルの信頼度(例:最大ソフトマックス確率、または負のエントロピー)のしきい値を学習する。
- そのしきい値は、信頼度がしきい値を超えるソース検証例の割合が、モデルのソース精度と一致するように選択される。
- ターゲットドメインの精度は、信頼度がその学習済みしきい値を超えるラベルなしターゲット例の割合として推定される。
- この手法は、ターゲットデータに対する追加のキャリブレーションや回帰を一切用いず、事前に訓練されたモデルの信頼度スコアに依存する。
- ATCは、ソースデータに対する後処理温度スケーリング(TS)キャリブレーションの有無を問わず評価され、そのロバストネスが検証された。
- 本手法は、ResNet、DenseNet、DistilBERTなどの視覚および言語モデルに適用され、ImageNet、Wilds、BREEDS、CIFAR、MNISTなどのデータセットで検証された。
実験結果
リサーチクエスチョン
- RQ1ラベル付きソースデータとラベルなしターゲットデータのみを用いて、OOD性能を正確に予測可能な条件は何か?
- RQ2複数のターゲットドメインからのラベル付きデータやキャリブレーションを必要とする既存手法と比較して、ATCはどのように異なるか?
- RQ3より複雑な回帰ベースやキャリブレーションベースのアプローチよりも、単純な信頼度しきい値手法が優れた性能を示せるか?
- RQ4OOD精度推定の理論的限界は何か?また、シフトタイプに関する仮定はこの限界にどのように影響するか?
- RQ5ATCは、合成的汚染、新しいサブポピュレーション、自然な分布シフトを含む多様なシフトタイプに一般化可能か?
主な発見
- ATCは、評価されたすべてのデータセットおよびシフトタイプにおいて、先行手法と比較して平均絶対推定誤差を2–4倍低減した。
- ImageNetの自然的シフトにおいて、ATCは平均絶対誤差(MAE)0.73を達成し、次に優れた手法(DOC)の2.22を上回った。
- 新規サブポピュレーションを含むFMoW-Wildsデータセットでは、ATCはMAE 9.94を達成し、DOC(13.24)や他のベースラインと比べて顕著に優れた性能を示した。
- ターゲットドメインのキャリブレーションが不要な状況でも、ATCは強固な性能を維持した。一方、キャリブレーションを必要とする手法は、未知の分布ではしばしば失敗する。
- アブレーションスタディでは、ロバストな線形モデルをフィッティングしてDOCの性能を向上させた後でも、ATCは回帰ベース手法を上回った。
- 本手法は、モデルアーキテクチャ(ResNet、DenseNet、FCN、DistilBERT)およびデータセット(視覚および言語)の両方で一般化可能であり、広範な実用的有用性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。