[論文レビュー] Fooling Explanations in Text Classifiers
本稿では、テキスト分類器の説明出力を著しく変化させつつも、元の分類器の予測を維持する、人間が認識できないテキストの摂動を生成するブラックボックス敵対的攻撃であるTEXTEXTPLANATIONFOOLER(TEF)を提案する。この攻撃は、複数のNLPモデルとデータセットにおいて、Integrated Gradientsからのサリエンシーマップのような説明出力を、人間が認識できない摂動によって著しく変化させる。主な貢献は、テキスト分類器における説明が極めて脆弱であることを示したことである。TEFは一部のケースで、説明の属性相関を最大0.75まで低下させた。これは、モデルへのアクセスが制限された半ユニバーサルな攻撃設定下でも成立する。
State-of-the-art text classification models are becoming increasingly reliant on deep neural networks (DNNs). Due to their black-box nature, faithful and robust explanation methods need to accompany classifiers for deployment in real-life scenarios. However, it has been shown in vision applications that explanation methods are susceptible to local, imperceptible perturbations that can significantly alter the explanations without changing the predicted classes. We show here that the existence of such perturbations extends to text classifiers as well. Specifically, we introduceTextExplanationFooler (TEF), a novel explanation attack algorithm that alters text input samples imperceptibly so that the outcome of widely-used explanation methods changes considerably while leaving classifier predictions unchanged. We evaluate the performance of the attribution robustness estimation performance in TEF on five sequence classification datasets, utilizing three DNN architectures and three transformer architectures for each dataset. TEF can significantly decrease the correlation between unchanged and perturbed input attributions, which shows that all models and explanation methods are susceptible to TEF perturbations. Moreover, we evaluate how the perturbations transfer to other model architectures and attribution methods, and show that TEF perturbations are also effective in scenarios where the target model and explanation method are unknown. Finally, we introduce a semi-universal attack that is able to compute fast, computationally light perturbations with no knowledge of the attacked classifier nor explanation method. Overall, our work shows that explanations in text classifiers are very fragile and users need to carefully address their robustness before relying on them in critical applications.
研究の動機と目的
- 小さな人間が認識できない入力摂動が、テキスト分類器の説明手法に与える脆弱性を明らかにすること。
- 分類器の予測を変更せずに説明出力を操作するブラックボックス攻撃、TEXTEXTPLANATIONFOOLER(TEF)を開発すること。
- さまざまなデータセット、モデル、説明手法における属性付け手法の耐性を評価すること。
- TEFの摂動が未知のモデルや説明手法にどのように転送可能かを示すこと。
- 攻撃時におけるモデルへのクエリが不要な、事前計算可能な半ユニバーサル攻撃ポリシーを導入すること。
提案手法
- TEFは、分類器の信頼度を維持しつつ、属性相関を最小化する語の置換を最適化することで、説明手法を標的とするブラックボックス敵対的攻撃を定式化する。
- 攻撃は、同義語置換と埋め込み類似度に基づく勾配フリー最適化戦略を用い、人間が認識できない摂動を生成する。
- 各入力に対して、元のと摂動後の属性マップ間のピアソン積率相関係数(PCC)の低下を最大化する摂動を計算する。
- 半ユニバーサル攻撃ポリシーは、データセットのサブセット上でTEF最適化摂動から頻出する置換を集約することで構築され、攻撃時にクエリ不要で高速な攻撃を可能にする。
- 説明の脆弱性を評価するために、元の属性と摂動後の属性間のPCCを用いる。PCCが低いほど、説明の脆弱性が高いことを示す。
- 実験は、3つのDNNと3つのトランスフォーマー・アーキテクチャを用いた5つのテキスト分類データセットで実施され、3つの説明手法(例:Integrated Gradients)が使用された。
実験結果
リサーチクエスチョン
- RQ1人間が認識できないテキスト摂動が、分類器の予測を維持したまま説明出力を著しく変化させることができるか?
- RQ2このような攻撃下で、さまざまなモデルとデータセットにおける異なる説明手法の耐性はどの程度か?
- RQ3TEFの摂動が未知のモデルや説明手法にどの程度転送可能か?
- RQ4攻撃時にターゲットモデルへのクエリが不要な、半ユニバーサル攻撃ポリシーを構築できるか?
- RQ5TEFによる属性付けの耐性低下は、ランダム攻撃やベースライン攻撃と比較してどの程度か?
主な発見
- TEFは属性相関を顕著に低下させ、複数の設定でPCCが0.2未満にまで低下した。これは、説明を著しく歪める高い有効性を示している。
- 平均して、TEFは元の属性と比較してPCCを最大0.75まで低下させた。これは、すべてのテスト対象のモデルとデータセットで説明が極めて脆弱であることを示している。
- 攻撃は未確認のモデルや説明手法に対しても効果的に転送され、NLPの説明分野全体に広範な脆弱性があることを示している。
- 半ユニバーサル攻撃ポリシーは、攻撃時にモデルへのクエリが不要なにもかかわらず、TEFと同等の性能を達成した。これは、実用的かつ耐性のある攻撃であることを証明している。
- ランダム攻撃ベースラインはTEFに比べて著しく劣っており、観察された劣化がランダムノイズではなく、標的付き摂動によるものであることを確認している。
- AG’s News、IMDB、MR、Rotten Tomatoes、Yelpの5つのすべてのデータセットにおいて、TEFは一貫して属性の正確性を低下させた。これは、現在の説明手法にシステム的な脆弱性があることを強力に示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。