Skip to main content
QUICK REVIEW

[논문 리뷰] Backdoor Attacks to Graph Neural Networks

Zaixi Zhang, Jinyuan Jia|arXiv (Cornell University)|2020. 06. 19.
Adversarial Robustness in Machine Learning참고 문헌 55인용 수 12
한 줄 요약

이 논문은 그래프 분류를 위한 그래프 신경망(GNNs)에 대한 처음으로 백도어 공격를 제시하며, 훈련 그래프에 주입된 하위그래프를 트리거로 사용하여 테스트 그래프에서 동일한 하위그래프가 나타날 경우 모델이 대상 레이블을 예측하도록 유도한다. 이 공격는 청소화 정확도에 미치는 영향을 최소화하면서도 높은 성공률을 기록하며, 무작위 부분 샘플링 방어 기법을 평가한 결과 일부 경우에 효과가 없음을 확인하여 더 강력한 방어 수단이 필요함을 시사한다.

ABSTRACT

In this work, we propose the first backdoor attack to graph neural networks (GNN). Specifically, we propose a \emph{subgraph based backdoor attack} to GNN for graph classification. In our backdoor attack, a GNN classifier predicts an attacker-chosen target label for a testing graph once a predefined subgraph is injected to the testing graph. Our empirical results on three real-world graph datasets show that our backdoor attacks are effective with a small impact on a GNN's prediction accuracy for clean testing graphs. Moreover, we generalize a randomized smoothing based certified defense to defend against our backdoor attacks. Our empirical results show that the defense is effective in some cases but ineffective in other cases, highlighting the needs of new defenses for our backdoor attacks.

연구 동기 및 목표

  • 그래프 분류의 맥락에서 그래프 신경망(GNNs)이 백도어 공격에 얼마나 취약한지 조사하기.
  • 일관된 트리거를 훈련 그래프에 주입하여 GNN 예측을 조작할 수 있는 하위그래프 기반 백도어 공격을 개발하기.
  • 제안된 백도어 공격에 대응하여 무작위 부분 샘플링 기반 인증 방어의 효과를 평가하기.
  • 기존의 인증 방어 기법이 GNNs에 대한 하위그래프 기반 백도어 공격에 충분하지 않음을 입증하기.
  • GNNs에 대한 백도어 탐지 및 강력한 방어 기법 개발을 위한 향후 연구를 촉진하기.

제안 방법

  • 공격는 네 가지 매개변수로 정의된 하위그래프 패턴을 트리거로 사용한다: 트리거 크기, 트리거 밀도, 트리거 합성 방법, 오염 강도.
  • 트리거는 지정된 크기와 밀도를 가진 무작위 하위그래프로 합성되며, 노드 간 연결을 대체하여 훈련 그래프의 일부에 삽입된다(오염 강도에 따라).
  • 오염된 훈련 그래프는 공격자가 선택한 대상 레이블로 재라벨링되어 백도어가 적용된 훈련 데이터셋을 형성한다.
  • GNN은 백도어가 적용된 데이터셋으로 훈련되어 트리거와 대상 레이블 간의 연관성을 학습한다.
  • 추론 단계에서 동일한 트리거가 테스트 그래프에 주입되면, 백도어가 적용된 GNN은 대상 레이블을 예측한다.
  • 무작위 부분 샘플링 기반 인증 방어 기법이 개선되어 공격에 대한 강건성 평가를 수행한다.

실험 결과

연구 질문

  • RQ1하위그래프 기반 백도어 공격는 청소화 그래프에서의 성능 저하 없이 그래프 분류를 위한 GNN 예측을 성공적으로 조작할 수 있는가?
  • RQ2무작위 부분 샘플링 기반 인증 방어는 하위그래프 기반 백도어 공격에 대해 GNN을 얼마나 효과적으로 보호하는가?
  • RQ3백도어 공격의 성공 여부는 주입된 하위그래프 트리거의 크기와 밀도에 의존하는가?
  • RQ4오염 강도는 백도어가 적용된 GNN의 공격 성공률와 청소화 정확도에 어떤 영향을 미치는가?
  • RQ5무작위 부분 샘플링 방어가 이러한 백도어 공격에 대해 인증 강건성을 제공하지 못하는 조건은 무엇인가?

주요 결과

  • 제안된 하위그래프 기반 백도어 공격는 비트코인, 트위터, COLLAB 세 가지 실세계 데이터셋에서 높은 공격 성공률를 기록한다.
  • 공격는 청소화 정확도를 높게 유지하면서도(예: 비트코인 및 트위터 데이터셋에서 >95%), 오염된 테스트 그래프에서 거의 100%의 공격 성공률를 달성한다.
  • 무작위 부분 샘플링 기반 인증 방어는 트리거 크기가 작을 경우 공격 성공률를 감소시키며 청소화 정확도 저하가 미미하다.
  • 트리거 크기가 클 경우 방어 기법은 효과를 잃게 되며, 인증에도 불구하고 공격 성공률는 높게 유지된다.
  • 결과적으로 현재의 인증 방어 기법은 하위그래프 기반 백도어 공격에 충분하지 않음을 입증하며, 새로운 방어 기법 개발이 절실한 필요성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.