Skip to main content
QUICK REVIEW

[論文レビュー] A Closer Look at Model Adaptation using Feature Distortion and Simplicity Bias

Puja Trivedi, Danai Koutra|arXiv (Cornell University)|Mar 23, 2023
Domain Adaptation and Few-Shot Learning被引用数 4
ひとこと要約

本論文は、LP+FTが特徴の歪みを低減することでOOD一般化を向上させることを特定しているが、依然として単純さバイアスに苦しんでおり、校正や耐性といった安全性指標に悪影響を与えていることを明らかにした。この問題を解決するために、仮想アドバーシャルトレーニング、不確実性駆動の摂動、スパーススープを用いた硬度促進型線形プローブ(LP)の変種を提案し、単純さバイアスを顕著に低減させ、3つの実世界データセットにおいて安全性と一般化性能の両方を向上させた。

ABSTRACT

Advances in the expressivity of pretrained models have increased interest in the design of adaptation protocols which enable safe and effective transfer learning. Going beyond conventional linear probing (LP) and fine tuning (FT) strategies, protocols that can effectively control feature distortion, i.e., the failure to update features orthogonal to the in-distribution, have been found to achieve improved out-of-distribution generalization (OOD). In order to limit this distortion, the LP+FT protocol, which first learns a linear probe and then uses this initialization for subsequent FT, was proposed. However, in this paper, we find when adaptation protocols (LP, FT, LP+FT) are also evaluated on a variety of safety objectives (e.g., calibration, robustness, etc.), a complementary perspective to feature distortion is helpful to explain protocol behavior. To this end, we study the susceptibility of protocols to simplicity bias (SB), i.e. the well-known propensity of deep neural networks to rely upon simple features, as SB has recently been shown to underlie several problems in robust generalization. Using a synthetic dataset, we demonstrate the susceptibility of existing protocols to SB. Given the strong effectiveness of LP+FT, we then propose modified linear probes that help mitigate SB, and lead to better initializations for subsequent FT. We verify the effectiveness of the proposed LP+FT variants for decreasing SB in a controlled setting, and their ability to improve OOD generalization and safety on three adaptation datasets.

研究の動機と目的

  • 既存の適応プロトコル(LP、微調整(FT)、LP+FT)が強力な一般化を示す一方で、安全性指標で性能を発揮しない理由を調査すること。
  • モデルが単純で壊れやすい特徴に依存する単純さバイアスの役割が、適応段階でのモデルの安全性を損なう仕組みを検討すること。
  • 特徴の歪みと単純さバイアスの両方を同時に軽減する、より良い分布外一般化と安全な一般化を実現する改善されたLP+FTプロトコルの設計。
  • 硬度促進型LP初期化がより耐性のある微調整をもたらし、安全性および一般化ベンチマークで優れた性能を発揮することの妥当性を検証すること。

提案手法

  • 単純な特徴と複雑な特徴の間の相関関係を制御可能な合成ドミノデータセットを用い、単純さバイアスを分離して測定する。
  • 一般化(ID/OOD正答率)と安全性(校正、耐性、異常検出)の両方の指標に対して、標準プロトコル(LP、FT、LP+FT)を評価する。
  • 仮想アドバーシャルトレーニング(VAT)、不確実性駆動の摂動(UDP)、スパーススープ(スープ)を用いた3つの改良型LP初期化手法を設計し、複雑で耐性のある特徴の学習を促進する。
  • これらの改善されたLP初期化をLP+FTフレームワークに適用し、その後の微調整が偏りが少なく、より耐性のある表現から開始されることを保証する。
  • CIFAR-10、CIFAR-10-C、DomainNetの3つの実世界データセットで、これらのプロトコルを訓練・評価し、複数の安全性および一般化指標におけるパフォーマンスを測定する。
  • 表現の類似度を評価するためにCKA(センター化されたカーネル整合性)を用い、事前学習済みモデルと適応済みモデル間の特徴空間の安定性を確認する。

実験結果

リサーチクエスチョン

  • RQ1LP+FTは特徴の歪みを低減しているものの、校正誤差や敵対的耐性といった安全性指標でなぜ性能を発揮しないのか?
  • RQ2標準的な適応プロトコル(LP、FT、LP+FT)はどの程度単純さバイアスを示しており、それが耐性や安全性にどのように影響するのか?
  • RQ3硬度促進型LP初期化(例:VAT、UDP、スープ)は、LP段階での単純さバイアスを低減させ、より安全で一般化性能の高い微調整済みモデルを実現できるのか?
  • RQ4改善されたLP初期化を用いた提案されたLP+FTバージョンは、実世界のデータセットにおいて、標準LP+FTに比べて分布外一般化性能および安全性指標で優れているか?

主な発見

  • LP+FTはOOD一般化に有効である一方で、校正誤差や汚染に対する耐性といった安全性指標ではLPおよびFTに劣っており、歪みの制御だけでは不十分であることが示された。
  • 合成ドミノデータセットでは、FTが単純さバイアスに対して最も感受性が高く、特徴相関が中程度のとき、LP+FTはバランスの取れた妥当なトレードオフを示した。
  • LP(VAT) + FTはCIFAR-10-Cで最高のOOD一般化(89.00%正答率)と耐性(93.75%汚染正答率)を達成し、標準LP+FTを上回った。
  • LP(Soup) + FTは最高の異常検出AUROC(0.9265)を記録し、校正性能も良好を維持し、安全性指標で標準LP+FTを上回った。
  • 改良型LP+FTプロトコル(特にLP(VAT)+FTおよびLP(Soup)+FT)は、表現類似度(CKA)と耐性の両面で顕著な向上を示し、複雑な特徴の保存が良好に保たれていることが示された。
  • 硬度促進型LP初期化は、合成環境下での単純さバイアスの低減を裏付けるものであり、実世界の安全性および一般化性能向上にも明確な寄与を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。