[論文レビュー] Adversarial attacks and defenses in explainable artificial intelligence: A survey
本調査は、説明可能なAI(XAI)手法に対する adversarial 攻撃およびその防御に関する包括的な分析を提供し、adversarial XAI(AdvXAI)分野の研究を体系化するための統一された分類法と表記法を導入する。説明手法における重要な脆弱性を特定し、防御戦略を評価し、高リスク応用分野におけるXAIの堅牢性と信頼性を高めるための今後の研究方向性を提示する。
Explainable artificial intelligence (XAI) methods are portrayed as a remedy for debugging and trusting statistical and deep learning models, as well as interpreting their predictions. However, recent advances in adversarial machine learning (AdvML) highlight the limitations and vulnerabilities of state-of-the-art explanation methods, putting their security and trustworthiness into question. The possibility of manipulating, fooling or fairwashing evidence of the model's reasoning has detrimental consequences when applied in high-stakes decision-making and knowledge discovery. This survey provides a comprehensive overview of research concerning adversarial attacks on explanations of machine learning models, as well as fairness metrics. We introduce a unified notation and taxonomy of methods facilitating a common ground for researchers and practitioners from the intersecting research fields of AdvML and XAI. We discuss how to defend against attacks and design robust interpretation methods. We contribute a list of existing insecurities in XAI and outline the emerging research directions in adversarial XAI (AdvXAI). Future work should address improving explanation methods and evaluation protocols to take into account the reported safety issues.
研究の動機と目的
- 説明可能なAI(XAI)手法を標的とする adversarial 攻撃に関する研究の増加を体系化すること。
- 特に高リスク意思決定文脈において、データおよびモデルの操作に起因するXAIの主な失敗モードを特定・分類すること。
- adversarial machine learning(AdvML)とXAI研究コミュニティの間のギャップを埋めるために、統一された表記法と分類法を提案すること。
- モデル正則化、集中サンプリング、アンサンブルベースの説明集約などの既存防御手法を評価すること。
- AdvXAIにおける新興課題、例えばXAI洗い、誤った説明に対する人間の感受性、規制上の影響を強調すること。
提案手法
- ICML、ICLR、NeurIPS、AAAI、AIj、NMIなどの主要なML会議およびその引用ネットワークを対象として、50篇以上の論文を系統的文献レビューした。これにより、adversarial XAI分野の核心的論文を同定した。
- XAIに対する adversarial 攻撃のための統一された分類法と表記法を導入し、データレベル、モデルレベル、説明レベルの攻撃を区別した。
- 攻撃の標的(例:特徴量の重要度、対応的要因、サリエンシーマップ)およびアクセスレベル(ホワイトボックス、ブラックボックス、グレイボックス)に基づいて攻撃を分類した。
- 防御戦略として、モデル正則化、データフィルタリング、単一手法の操作に対して脆弱性を低減するアンサンブル型説明手法を分析した。
- 説明手法のパッチ適用とトレーニング段階での防御によるモデルの堅牢性向上の有効性を比較した。
- 人間要因、例えば情報過多や誤った説明への感受性が、実世界の展開環境に与える影響を評価した。

実験結果
リサーチクエスチョン
- RQ1adversarial 攻撃は、司法判断や医療診断など高リスク分野において、XAI手法の信頼性とセキュリティをどのように損なうのか?
- RQ2データまたはモデルパラメータの adversarial 変更を受けた場合、XAIの主な失敗モードは何か?
- RQ3モデル正則化、データフィルタリング、説明アンサンブルなどの既存防御手法は、説明に対する adversarial 脅威をどの程度効果的に緩和できるか?
- RQ4公平性メトリクス(例:人口統一、同等機会)に対する攻撃と説明手法に対する攻撃がどのように重なり合い、エーティカルAIにどのような影響を及えるか?
- RQ5adversarial XAI分野における主な研究ギャップと今後の研究方向性は何か。特に認証、実際のインcidント追跡、規制準拠の観点から。
主な発見
- adversarial 攻撃は、モデルの予測を変更せずに、サリエンシーマップや特徴量の重要度といったXAI出力を操作でき、モデル説明への信頼を損なう。
- モデルへのアクセスがなくても、説明アルゴリズムの構造を突く最適化技術を用いることで、説明手法に対するブラックボックス攻撃が可能である。
- アンサンブルベースの説明手法は、攻撃者が通常1つの説明手法を標的にするため、adversarial パerturbationに対してより高い堅牢性を示す。
- モデル正則化と集中データサンプリングは、モデルとその説明の両方の堅牢性を向上させる有効な防御戦略である。
- 「XAI洗い(XAI-washing)」のリスクが高まっており、企業が規制や法的要件を満たすために、事実上信頼できる説明を用いていると誤って主張する事例が増えている。
- 人間のステークホルダーは、誤ったまたは過剰な説明に影響を受けやすく、XAIの堅牢性を人間中心の評価で検証する必要がある。
![Figure 2: Adversarial example is the most common attack on local explanations of the image classifier’s prediction. Left [adapted from 40 ] : An original image is classified as a “dog” and its explanation points out to features influencing this decision. The image can be adversarially changed with p](https://ar5iv.labs.arxiv.org/html/2306.06123/assets/x2.png)
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。