Skip to main content
QUICK REVIEW

[논문 리뷰] Explainability-based Backdoor Attacks Against Graph Neural Networks

Jing Xu, Minhui|arXiv (Cornell University)|2021. 04. 08.
Adversarial Robustness in Machine Learning참고 문헌 22인용 수 14
한 줄 요약

이 논문은 그래프 신경망(GNN)에 대한 설명 가능성 기반 뒷통수 공격을 제안하며, GNNExplainer와 GraphLIME를 활용해 최적의 트리거 삽입 위치를 특정한다. 그래프 분류의 경우 하위그래프를, 노드 분류의 경우 가장 중요도가 낮은 노드 특징을 대상으로 한다. 이 방법은 2.5% 이하의 정상 정확도 감소로 84% 이상의 공격 성공률을 달성하여 탐지에 쉽게 둔갑하는 고성능 공격을 가능하게 한다.

ABSTRACT

Backdoor attacks represent a serious threat to neural network models. A backdoored model will misclassify the trigger-embedded inputs into an attacker-chosen target label while performing normally on other benign inputs. There are already numerous works on backdoor attacks on neural networks, but only a few works consider graph neural networks (GNNs). As such, there is no intensive research on explaining the impact of trigger injecting position on the performance of backdoor attacks on GNNs. To bridge this gap, we conduct an experimental investigation on the performance of backdoor attacks on GNNs. We apply two powerful GNN explainability approaches to select the optimal trigger injecting position to achieve two attacker objectives -- high attack success rate and low clean accuracy drop. Our empirical results on benchmark datasets and state-of-the-art neural network models demonstrate the proposed method's effectiveness in selecting trigger injecting position for backdoor attacks on GNNs. For instance, on the node classification task, the backdoor attack with trigger injecting position selected by GraphLIME reaches over $84 \%$ attack success rate with less than $2.5 \%$ accuracy drop

연구 동기 및 목표

  • 그래프 신경망(GNN)에서 트리거 삽입 위치의 선택이 뒷통수 공격 성능에 미치는 영향, 특히 공격 성공률과 정상 정확도 감소 측면에서의 영향을 조사한다.
  • GNN 설명 가능성 기법을 활용해 최적의 트리거 삽입 위치를 선정하는 실용적이고 효율적인 방법을 개발한다.
  • 가장 중요도가 낮은 그래프 구조나 특징을 대상으로 하여 뒷통수 공격의 은밀함을 높이고, 탐지 가능성을 감소시킨다.
  • 특히 노드 및 그래프 분류 작업을 위한 GNN 뒷통수 공격에서 설명 가능성 기반 트리거 배치에 대한 연구 격차를 메운다.
  • GNNExplainer와 GraphLIME와 같은 설명 가능성 도구를 활용해 고성능 뒷통수 공격을 구현할 수 있음을 입증한다.

제안 방법

  • 그래프 분류 작업에서 트리거 삽입을 위한 가장 영향력 있는 하위그래프를 식별하기 위해 GNNExplainer를 활용한다.
  • 노드의 국소적 특징 중요도 점수를 계산하기 위해 GraphLIME를 적용하여, 노드 분류에서 가장 중요도가 낮은 특징을 선정할 수 있도록 한다.
  • 선택된 하위그래프 또는 노드 특징을 고정된 값으로 수정하여 트리거를 삽입함으로써, 정상 입력에 대한 모델 기능을 유지한다.
  • 세 가지 전략을 결합한 공격 전략을 적용한다: 랜덤 선택(RSA), 가장 중요한 특징(MIA), 가장 중요도가 낮은 특징(LIA)을 활용한 특징 기반 트리거.
  • 다양한 GNN 아키텍처(GIN, GraphSAGE, GAT)와 벤치마크 데이터셋(Cora, CiteSeer, Mutagenicity, Facebook)을 대상으로 공격 성능을 평가한다.
  • 설명 가능성 방법을 활용해 트리거 배치를 안내함으로써, 고성능 공격 성공률를 확보하면서도 정상 정확도 저하를 최소화한다.

실험 결과

연구 질문

  • RQ1트리거 삽입 위치의 선택이 GNN 뒷통수 공격에서 공격 성공률와 정상 정확도 감소에 어떤 영향을 미치는가?
  • RQ2GNN 설명 가능성 방법, 예를 들어 GNNExplainer와 GraphLIME는 최적의 트리거 삽입 위치를 효과적으로 식별하는 데 사용될 수 있는가?
  • RQ3가장 중요도가 낮은 그래프 구조나 특징을 대상으로 하면 GNN 뒷통수 공격의 은밀함이 향상되는가?
  • RQ4다양한 GNN 모델과 데이터셋에서 설명 가능성 기반 공격의 성능는 어떻게 비교되는가?
  • RQ5설명 가능성 기반 트리거 배치는 정상 모델 정확도에 미치는 영향을 최소화하면서도 높은 공격 성공률를 달성할 수 있는가?

주요 결과

  • 노드 분류 작업에서 가장 중요도가 낮은 특징을 선택하는 공격(LIA)은 Cora와 CiteSeer 데이터셋에서 2.5% 이하의 정상 정확도 감소로 84% 이상의 공격 성공률를 달성했다.
  • Cora 데이터셋에서 LIA는 84.22%의 공격 성공률와 1.95%의 정상 정확도 감소를 기록했으며, MIA는 각각 84.11%와 0.66%를 기록하여 가장 중요도가 낮은 특징을 대상으로 할 경우 성능 저하가 최소화됨을 시사한다.
  • Mutagenicity 데이터셋에서 GNNExplainer 기반 공격는 최적의 하위그래프를 활용해 98.24%의 공격 성공률와 2.80%의 정상 정확도 감소를 기록했다.
  • GraphLIME를 사용해 최적의 트리거 위치를 선택하는 데 평균 소요 시간은 Cora에서 0.06초, CiteSeer에서 0.09초로, 계산상의 타당성을 입증했다.
  • 가장 중요도가 낮은 특징을 대상으로 하는 공격(LIA)는 랜덤 선택(RSA)과 유사한 공격 성공률를 기록하여 은밀한 트리거가 랜덤 트리거만큼 효과적일 수 있음을 시사한다.
  • 결과는 설명 가능성 기반 트리거 배치가, 특히 영향력이 낮은 그래프 구성요소를 대상으로 할 경우 낮은 탐지 가능성을 가진 고성능 뒷통수 공격를 가능하게 함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.