[論文レビュー] Feature Attributions and Counterfactual Explanations Can Be Manipulated
本稿では、特徴量の寄与度を評価する手法(例:LIME、SHAP)および対向的説明(例:Wachterのアルゴリズム、DiCE)が、攻撃者によってモデルのバイアスを隠すように操作可能であることを示している。特別に設計された目的関数を用いてバイアスを持つモデルを訓練することで、説明は公平で偏りがないように見えるが、実際には保護群に対して系統的に不利な影響を及ぼすモデルであることを実証している。
As machine learning models are increasingly used in critical decision-making settings (e.g., healthcare, finance), there has been a growing emphasis on developing methods to explain model predictions. Such extit{explanations} are used to understand and establish trust in models and are vital components in machine learning pipelines. Though explanations are a critical piece in these systems, there is little understanding about how they are vulnerable to manipulation by adversaries. In this paper, we discuss how two broad classes of explanations are vulnerable to manipulation. We demonstrate how adversaries can design biased models that manipulate model agnostic feature attribution methods (e.g., LIME \& SHAP) and counterfactual explanations that hill-climb during the counterfactual search (e.g., Wachter's Algorithm \& DiCE) into extit{concealing} the model's biases. These vulnerabilities allow an adversary to deploy a biased model, yet explanations will not reveal this bias, thereby deceiving stakeholders into trusting the model. We evaluate the manipulations on real world data sets, including COMPAS and Communities \& Crime, and find explanations can be manipulated in practice.
研究の動機と目的
- 後処理による説明手法(特に特徴量の寄与度と対向的説明)が、モデルバイアスを隠すように操作可能かどうかを調査すること。
- 攻撃者が、説明では公平に見えるが予測では本質的に不平等であるモデルを訓練できるかどうかを実証すること。
- 最先端の説明手法を用いて、実世界のデータセット(COMPAS、Communities & Crime)がこうした操作に対してどの程度脆弱であるかを評価すること。
- 対向的説明が、保護群でないグループに対して低コストの是正策を生み出すように操作可能であり、元のデータでは公平に見えるように保てるかどうかを示すこと。
提案手法
- モデル分類損失を最小化し、対向的説明における公平性を確保するとともに、入力空間における小さな摂動を制約する二段階最適化の目的関数を設計する。
- 黒ボックスの対向的アルゴリズム(例:Wachterのアルゴリズム、DiCE)を訓練中に逆伝播可能にするために、暗黙の微分を用いる。
- 対向的是正の公平性、摂動によるコスト低減による不平等、および小さな摂動制約を含む損失関数を用いてニューラルネットワークモデルを訓練する。
- 保護群でないインスタンスに学習された摂動ベクトル δ を適用し、対向的説明のコストを低減するが、元のデータでは是正コストの差が小さいままに保つ。
- 説明の忠実性と是正コスト差の両方を評価する。具体的には、保護群と非保護群間の平均是正コストの差(公平性の差)と、摂動後のコストと摂動前のコストの比(コスト低減比)を評価する。
- 実世界のデータセット(Communities & Crime、COMPAS)を用い、LIME、SHAP、Wachterのアルゴリズム、Sparse Wachter、DiCE、およびプロトタイプ誘導型対向的説明を用いて評価する。
実験結果
リサーチクエスチョン
- RQ1攻撃者は、予測ではバイアスがあるものの、特徴量の寄与度(例:LIME、SHAP)では公平に見える機械学習モデルを設計可能だろうか?
- RQ2対向的説明手法は、元のデータでは公平に見えるが、非保護群に対して低コストの是正策を生み出すように操作可能だろうか?
- RQ3勾配上昇型対向的アルゴリズム(例:Wachterのアルゴリズム、DiCE)は、小さな入力摂動に対してどのように異なる結果を生じるか。これにより、操作が可能になるか?
- RQ4提案手法の操作戦略は、説明の忠実性と是正コスト差の両面において、実世界のデータセットで実際にどの程度有効か?
主な発見
- 操作されたモデルは、Communities & Crimeデータセットにおいてベースラインモデルと1%以内の精度で、性能劣化は最小限に抑えられた。
- 元のデータでは、保護群と非保護群間の平均是正コストの差が非常に小さく(例:Wachterのアルゴリズムで0.37、DiCEで6.99)、一見公平に見える。
- 摂動 δ を適用した後、非保護群の是正コストは顕著に低下し、Wachterのアルゴリズムでは最大20.1倍のコスト低減比を達成した。
- DiCEではコスト低減比が4.5倍に達し、操作後、非保護群の個人が容易に低コストの是正策を得られることを示した。
- 結果として、対向的説明が隠れたバイアスを隠すように操作可能であり、説明では公平に見えるが実際には不平等なモデルが実現可能であることが示された。
- 操作はWachterのアルゴリズム、DiCE、およびプロトタイプ誘導型手法を含む複数の対向的アルゴリズムに効果を示し、広範な脆弱性を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。