Skip to main content
QUICK REVIEW

[논문 리뷰] Defending Against Backdoor Attack on Graph Nerual Network by Explainability

Bingchen Jiang, Zhao Li|arXiv (Cornell University)|2022. 09. 07.
Adversarial Robustness in Machine Learning인용 수 7
한 줄 요약

이 논문은 그래프 신경망(GNN)의 백도어 공격에 대해 설명 가능성 기반의 방어 기법을 처음으로 제안한다. 설명 가능성 점수(ES)를 활용해 영향력이 높은 부분그래프(즉, 트리거를 나타냄)를 탐지함으로써 입력 그래프 내 악성 부분구조를 식별하고 제거함으로써, 다양한 데이터셋에서 공격 성공률을 크게 낮추면서도 정상 샘플의 정확도를 유지한다.

ABSTRACT

Backdoor attack is a powerful attack algorithm to deep learning model. Recently, GNN's vulnerability to backdoor attack has been proved especially on graph classification task. In this paper, we propose the first backdoor detection and defense method on GNN. Most backdoor attack depends on injecting small but influential trigger to the clean sample. For graph data, current backdoor attack focus on manipulating the graph structure to inject the trigger. We find that there are apparent differences between benign samples and malicious samples in some explanatory evaluation metrics, such as fidelity and infidelity. After identifying the malicious sample, the explainability of the GNN model can help us capture the most significant subgraph which is probably the trigger in a trojan graph. We use various dataset and different attack settings to prove the effectiveness of our defense method. The attack success rate all turns out to decrease considerably.

연구 동기 및 목표

  • GNN, 특히 그래프 분류 작업에서 백도어 탐지 및 방어 기법의 부재 문제를 해결하기 위해.
  • 기존 탐지 방법을 회피할 수 있는 도구로서 은밀하고 구조적으로 다양성이 있는 백도어 트리거를 GNN에서 식별하기 위해.
  • 트리거에 대한 사전 지식 없이도 다양한 트리거 패턴과 그래프 구조에 대해 강건한 방어 기법을 개발하기 위해.
  • 정상 샘플에 대한 높은 모델 정확도를 유지하면서도 백도어 공격을 효과적으로 무력화하기 위해.

제안 방법

  • GNN 예측에 대한 부분그래프의 영향력을 수량화하기 위해 설명 가능성 점수(ES)를 도입하여, 유해한 부분그래프와 정상 부분그래프를 구분한다.
  • 기울기 기반 설명 방법을 사용해 각 입력 그래프에서 가장 영향력이 큰 부분그래프(잠재적 트리거)를 식별한다.
  • 적응형 희소성 제어를 적용해 고ES 부분그래프 내 간선을 제거함으로써 트리거 구조를 효과적으로 파괴한다.
  • 검증 세트에서 관찰된 최대 ES 값에 대한 임계값을 설정하여 들어오는 샘플을 정상 또는 악성으로 분류한다.
  • 설명 가능성의 충실도 및 비충실도 메트릭을 활용해 백도어 트리거로 인한 구조적 이상을 탐지한다.
  • 특정 간선 제거를 통해 트로이안이 난 샘플을 정상 샘플로 변형함으로써 백도어를 무력화한다.

실험 결과

연구 질문

  • RQ1충실도 및 비충실도와 같은 설명 가능성 메트릭이 정상 및 백도어 그래프 샘플을 효과적으로 구분할 수 있는가?
  • RQ2일관된 트리거 무관 방어 기법이 다양한 백도어 트리거를 GNN에서 탐지하고 제거할 수 있는가?
  • RQ3적응형 희소성 제어를 통해 고ES 부분그래프를 제거하는 것이 정상 샘플 성능에 영향을 주지 않으면서도 백도어 공격을 효과적으로 무력화하는가?
  • RQ4모델 표현력이 GNN에서 백도어 공격의 탐지 가능성과 성공률에 어떤 영향을 미치는가?
  • RQ5이 방법이 희소 그래프에서 백도어를 탐지하는 데 가지는 한계는 무엇인가?

주요 결과

  • 제안된 방법은 다양한 공격 설정 하에서 세 개의 실세계 그래프 데이터셋에서 낮은 오류 수용률(FAR)과 낮은 오류 거부률(FRR)을 달성한다.
  • 방어 후 공격 성공률(ASR)이 크게 감소하며, 특히 모델 표현력이 낮을 경우 두드러진다. 이는 백도어 학습이 모델 용량에 민감함을 시사한다.
  • 모델 파라미터가 작을 경우(예: 4611), ASR는 천천히 상승하고 정상 정확도가 높아진 후에도 낮은 수준을 유지한다. 이는 조기 정지 전략이 공격 완화에 기여할 수 있음을 시사한다.
  • 모델 표현력이 높을 경우(예: 27973 파라미터), ASR는 급격히 증가하며 정상 정확도와 강한 상관관계를 보이며, 트리거 학습이 더 쉬운 것을 나타낸다.
  • 희소 그래프에서는 성능이 열악하며, 간선 제거가 더 큰 영향을 미치고 트리거를 분리하기 어려워지므로, 탐지되지 않은 악성 샘플의 분포에서 이를 확인할 수 있다.
  • 크기가 큰 트리거일수록 ASR 증가 속도가 빨라지지만 은폐성이 떨어지므로, 공격자에게는 상충 관계가 존재하며, 이는 향후 방어 전략 수립에 도움이 될 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.