[論文レビュー] Contrastive Adapters for Foundation Model Group Robustness
本稿では、基礎モデル(FM)の微調整を伴わずにグループ分布シフトに対するロバストネスを向上させる手法として、対照的アダプタを提案する。同じクラスに属するサンプルの埋め込みを近づけ、異なるクラスのものを遠ざける対照的損失を用いて軽量なアダプタを訓練することで、9つのベンチマークで最悪グループ精度が8.5〜56.0パーセンテージポイント向上し、全モデル再訓練に匹敵する性能を達成しながら、パラメータの1%未満しか訓練しない。
While large pretrained foundation models (FMs) have shown remarkable zero-shot classification robustness to dataset-level distribution shifts, their robustness to subpopulation or group shifts is relatively underexplored. We study this problem, and find that FMs such as CLIP may not be robust to various group shifts. Across 9 robustness benchmarks, zero-shot classification with their embeddings results in gaps of up to 80.7 percentage points (pp) between average and worst-group accuracy. Unfortunately, existing methods to improve robustness require retraining, which can be prohibitively expensive on large foundation models. We also find that efficient ways to improve model inference (e.g., via adapters, lightweight networks with FM embeddings as inputs) do not consistently improve and can sometimes hurt group robustness compared to zero-shot (e.g., increasing the accuracy gap by 50.1 pp on CelebA). We thus develop an adapter training strategy to effectively and efficiently improve FM group robustness. Our motivating observation is that while poor robustness results from groups in the same class being embedded far apart in the foundation model "embedding space," standard adapter training may not bring these points closer together. We thus propose contrastive adapting, which trains adapters with contrastive learning to bring sample embeddings close to both their ground-truth class embeddings and other sample embeddings in the same class. Across the 9 benchmarks, our approach consistently improves group robustness, raising worst-group accuracy by 8.5 to 56.0 pp over zero-shot. Our approach is also efficient, doing so without any FM finetuning and only a fixed set of frozen FM embeddings. On benchmarks such as Waterbirds and CelebA, this leads to worst-group accuracy comparable to state-of-the-art methods that retrain entire models, while only training $\leq$1% of the model parameters.
研究の動機と目的
- ゼロショット分類におけるサブポピュレーションまたはグループ分布シフトに対する基礎モデル(FM)のロバストネスを調査すること。
- 高価な全モデル微調整を伴わず、FMのグループロバストネスを向上させる課題に対処すること。
- 事前学習済みFMの埋め込みのみを用いて、効率的かつアダプタベースの手法でロバストネスを向上させること。
- 標準的なアダプタ法や線形プローブ法で見られる一貫性の欠如やロバストネスの低下を回避すること。
- 同じクラスのサンプルの埋め込みが埋め込み空間で一致するように明示的に整列する訓練戦略を設計すること。
提案手法
- FMの埋め込みを固定した状態で、分類性能を向上させるために軽量なアダプタを訓練する。
- 同じクラスのサンプル埋め込みが埋め込み空間で近づくように促す対照的損失を用いる。
- 陽性ペア(同じクラス)を引き寄せ、陰性ペア(異なるクラス)を遠ざける教師あり対照的損失を適用する。
- クラスレベルの整列を維持するための標準的なクロスエントロピー損失に加え、サンプルレベルの埋め込みに対する対照的正則化を追加する。
- FMの微調整なしに、FMが提供する埋め込みのみを用いてアダプタをエンドツーエンドで訓練する。
- FMを固定し、埋め込みを固定したまま、アダプタパラメータのみを訓練することで、効率性を確保する。
実験結果
リサーチクエスチョン
- RQ1基礎モデルは、グループ分布シフト下でもゼロショット性能をすべてのサブポピュレーションで維持できるか?
- RQ2なぜ標準的なアダプタ法や線形プローブ法は、ロバストネスを向上させるのではなく、逆に低下させることがあるのか?
- RQ3対照的学習は、アダプタ訓練に効果的に適用可能で、同じクラスのサンプルの埋め込みが埋め込み空間で整列するようにできるか?
- RQ4基礎モデルの微調整なしに、最悪グループ精度を著しく向上させることは可能か?
- RQ5全モデル再訓練を必要とする最先端の手法と比較して、対照的アダプタはロバストネスと効率性の面でどのように差をつけるか?
主な発見
- 9つのロバストネスベンチマークにおいて、対照的アダプタはゼロショット分類に比べて最悪グループ精度が8.5〜56.0パーセンテージポイント向上した。
- CelebAデータセットでは、対照的アダプタが90.0%の最悪グループ精度を達成したのに対し、ゼロショットは74.0%、WiSE-FTは89.6%であり、すべてのベースラインを上回った。
- CelebAでは、対照的アダプタが最悪グループ精度のギャップをたった0.7パーセンテージポイントにまで縮小した。ゼロショットでは7.9パーセンテージポイントのギャップがあった。
- Waterbirdsでは、対照的アダプタが83.7%の最悪グループ精度を達成し、ゼロショット(49.8%)やERMアダプタ(60.8%)を著しく上回った。
- 全モデル再訓練手法(例:WiSE-FT)と同等の性能を達成しながら、モデルパラメータの1%未満しか訓練しなかった。
- 対照的アダプタは、標準アダプタが失敗するようなグループ不均衡な状況でも、一貫してロバストネスを向上させた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。