Skip to main content
QUICK REVIEW

[論文レビュー] Defending Against Backdoor Attack on Graph Nerual Network by Explainability

Bingchen Jiang, Zhao Li|arXiv (Cornell University)|Sep 7, 2022
Adversarial Robustness in Machine Learning被引用数 7
ひとこと要約

本稿では、グラフニューラルネットワーク(GNN)におけるバックドア攻撃に対する説明可能性ドリブンの防御手法を初めて提案する。説明可能性スコア(ES)を活用して、影響力が強い部分グラフ(すなわち、トリガーを示すもの)を特定し、入力グラフ内の悪意ある部分構造を同定・削除することで、複数のデータセットで攻撃成功確率を顕著に低下させる一方、正常なサンプルの精度を維持する。

ABSTRACT

Backdoor attack is a powerful attack algorithm to deep learning model. Recently, GNN's vulnerability to backdoor attack has been proved especially on graph classification task. In this paper, we propose the first backdoor detection and defense method on GNN. Most backdoor attack depends on injecting small but influential trigger to the clean sample. For graph data, current backdoor attack focus on manipulating the graph structure to inject the trigger. We find that there are apparent differences between benign samples and malicious samples in some explanatory evaluation metrics, such as fidelity and infidelity. After identifying the malicious sample, the explainability of the GNN model can help us capture the most significant subgraph which is probably the trigger in a trojan graph. We use various dataset and different attack settings to prove the effectiveness of our defense method. The attack success rate all turns out to decrease considerably.

研究の動機と目的

  • GNN、特にグラフ分類タスクにおいて、バックドア検出および防御メカニズムの不足に取り組むこと。
  • 従来の検出手法を回避する、巧妙で構造的に多様なバックドアトリガーをGNNで特定すること。
  • トリガーの事前知識に依存せず、さまざまなトリガーパターンやグラフ構造に耐性を持つ防御を構築すること。
  • 正常なサンプルの精度を高く維持しつつ、バックドア攻撃を効果的に無効化すること。

提案手法

  • GNNの予測に与える部分グラフの影響を定量化するための説明可能性スコア(ES)を導入し、良性と悪意ある部分グラフを区別する。
  • 勾配ベースの説明手法を用いて、各入力グラフにおける最も影響力の強い部分グラフ(潜在的なトリガー)を同定する。
  • 適応的スパarsity制御を適用し、高ES部分グラフ内のエッジを削除することで、トリガー構造を効果的に破壊する。
  • 検証セットで観測された最大ES値に閾値を設定し、受信サンプルを正常または悪意あるものに分類する。
  • 説明可能性における忠実度(fidelity)と不忠実度(infidelity)の指標を活用し、バックドアトリガーによって引き起こされる構造的異常を検出する。
  • 標的的なエッジ削除により、トロイの木馬が施されたサンプルを正常な状態に変換し、バックドアを無効化する。

実験結果

リサーチクエスチョン

  • RQ1忠実度と不忠実度といった説明可能性指標は、良性とバックドアが施されたグラフサンプルを効果的に区別できるか?
  • RQ2一様なトリガーに依存しない防御機構は、GNNにおける多様なバックドアトリガーを検出し、削除できるか?
  • RQ3適応的スパarsityを用いて高ES部分グラフを削除することで、正常なサンプルの性能を損なうことなくバックドア攻撃を効果的に無効化できるか?
  • RQ4モデルの表現力が、GNNにおけるバックドア攻撃の検出可能性と成功確率に与える影響は何か?
  • RQ5本手法はスパースなグラフにおけるバックドア検出にどのような限界を示すか?

主な発見

  • 提案手法は、さまざまな攻撃設定下で、3つの実世界のグラフデータセットにおいて、低誤受容率(FAR)と低誤拒否率(FRR)を達成した。
  • 防御後、攻撃成功確率(ASR)は顕著に低下した。特にモデル表現力が低い場合に顕著で、バックドア学習がモデル容量に敏感であることを示唆している。
  • モデルパラメータが小さい場合(例:4611)、ASRはゆっくり上昇し、高い正常精度に達しても依然として低く保たれるため、早期停止が攻撃を緩和できる可能性がある。
  • モデル表現力が高い場合(例:27973パラメータ)、ASRは急激に上昇し、正常精度と強く相関するため、トリガー学習が容易であることが示された。
  • スパースなグラフでは本手法の性能が著しく低下し、エッジ削除がより深刻な影響を及ぼし、トリガーの分離が困難であることが、未検出の悪意あるサンプルの分布から明らかになった。
  • 大きなトリガーはASRの上昇を加速するが、隠蔽性を低下させるため、攻撃者にとってのトレードオフを示しており、将来的な防御戦略に有用である可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。