[논문 리뷰] Towards More Practical Adversarial Attacks on Graph Neural Networks
이 논문은 모델 파라미터나 예측 결과에 접근할 수 없고, 노드의 일부만 접근 가능한 현실적인 제약 조건 하에 그래프 신경망(GNNs)에 대한 실용적인 블랙박스 적대적 공격을 제안한다. GNN의 구조적 인도적 편향을 랜덤 워크와 연결하여, 모델에 종속되지 않는 중요도 점수(RWCS)를 유도하고, 오차 감소 효과를 고려한 탐욕적 보정 절차를 도입함으로써 오분류율을 크게 향상시켰으며, Cora, Citeseer, PubMed와 같은 실제 데이터셋에서 기존 기준 방법들을 능가한다.
We study the black-box attacks on graph neural networks (GNNs) under a novel and realistic constraint: attackers have access to only a subset of nodes in the network, and they can only attack a small number of them. A node selection step is essential under this setup. We demonstrate that the structural inductive biases of GNN models can be an effective source for this type of attacks. Specifically, by exploiting the connection between the backward propagation of GNNs and random walks, we show that the common gradient-based white-box attacks can be generalized to the black-box setting via the connection between the gradient and an importance score similar to PageRank. In practice, we find attacks based on this importance score indeed increase the classification loss by a large margin, but they fail to significantly increase the mis-classification rate. Our theoretical and empirical analyses suggest that there is a discrepancy between the loss and mis-classification rate, as the latter presents a diminishing-return pattern when the number of attacked nodes increases. Therefore, we propose a greedy procedure to correct the importance score that takes into account of the diminishing-return pattern. Experimental results show that the proposed procedure can significantly increase the mis-classification rate of common GNNs on real-world data without access to model parameters nor predictions.
연구 동기 및 목표
- 기존의 적대적 공격 설정과 실제 환경의 제약 조건 사이의 격차를 해소하기 위해, 공격자가 노드에 대한 접근이 제한되고 모델 파라미터나 예측 결과에 대한 지식이 없는 상황을 고려한다.
- 모델 파라미터나 관측 가능성이 매우 제한된 상황에서도 효과적인 실용적 블랙박스 공격 전략을 GNN에 대해 개발한다.
- 모델 기반의 기울기나 예측 결과가 없이도 GNN의 구조적 인도적 편향—특히 랜덤 워크와의 연결성—을 활용해 공격에 유용한 정보를 도출한다.
- 점차 감소하는 오차 감소 효과를 보완하기 위해, 경험적 손실 동역학을 기반으로 중요도 점수를 보정하는 탐욕적 절차를 도입함으로써 오분류율 향상을 도모한다.
제안 방법
- GNN의 역전파 과정을 랜덤 워크 과정과 연결함으로써, 기울기 접근이 불가능한 환경에서도 모델에 종속되지 않는 중요도 점수(RWCS)를 유도한다.
- 백색 상자 기반의 기울기 공격을 기울기 노름 대신 그래프 구조에서 유도된 PageRank 유사 점수로 일반화함으로써 블랙박스 환경에 적합하게 확장한다.
- 오분류율 향상에 따른 점차 감소하는 효과를 반영하기 위해, 탐욕적 보정 절차를 도입하여 중요도 점수를 조정한다.
- 모델 파라미터, 예측 결과, 훈련 데이터에 접근하지 않고도 그래프 구조만을 사용한다.
- GCN 및 JK-Net 모델을 사용하여 공격 예산과 노드 접근 한도를 다양하게 설정한 상황에서 세 가지 벤치마크 데이터셋(Cora, Citeseer, PubMed)에서 평가한다.
실험 결과
연구 질문
- RQ1모델 파라미터와 예측 결과를 알 수 없는 상황에서 GNN의 구조적 인도적 편향을 어떻게 활용하여 효과적인 블랙박스 공격을 수행할 수 있는가?
- RQ2더 많은 노드를 공격할수록 오분류율은 어떻게 변화하는가? 그리고 점차 감소하는 효과를 보이는가?
- RQ3랜덤 워크에서 유도된 모델에 종속되지 않는 중요도 점수가 블랙박스 공격에서 노드 선택을 효과적으로 이끌 수 있는가?
- RQ4점차 감소하는 효과를 보완하기 위해 탐욕적 보정 절차를 도입함으로써 오분류율을 향상시킬 수 있는가?
주요 결과
- 제안된 GC-RWCS 공격 전략은 동일한 블랙박스 제약 조건 하에서 세 벤치마크 데이터셋 전반에서 기존 기준 방법들을 뛰어넘는 성능을 보였다.
- 10% 노드 접근 조건에서 Cora 데이터셋에서 GCN 정확도는 85.6%에서 78.5%로 7.1%p 감소하였으며, Pagerank 및 Betweenness보다 1.5점 이상 뛰어났다.
- 30% 노드 접근 조건에서 Cora 데이터셋에서 GCN 정확도는 80.7%로 떨어졌고, Random(82.6%) 및 Degree(80.7%) 기준보다 뚜렷이 뛰어났다.
- 모든 데이터셋과 모델에서 모든 기준 방법보다 통계적으로 유의미한 향상(p < 0.05)을 달성하였다.
- 실험 결과는 오분류율에 점차 감소하는 효과가 있음을 확인하였으며, 이는 탐욕적 보정 절차를 통해 노드 선택을 최적화할 필요성을 뒷받침한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.