[논문 리뷰] Black-box Gradient Attack on Graph Neural Networks: Deeper Insights in Graph-based Attack and Defense
이 논문은 훈련 데이터, 모델 파라미터, 또는 쿼리 기반 피드백에 접근할 필요가 없는, 그래프 신경망에 대한 첫 번째 기울기 기반 블랙박스 공격인 블랙박스 기울기 공격(BBGA)을 제안한다. 스펙트럴 클러스터링을 활용해 가짜 레이블을 생성하고 k-폴드 그리디 전략을 적용함으로써 BBGA는 그래프 전반에 걸쳐 균일한 교란 분포를 달성하며, 훈련 세트에 의존하지 않고도 기존 방법들을 능가하는 오분류율을 달성한다.
Graph Neural Networks (GNNs) have received significant attention due to their state-of-the-art performance on various graph representation learning tasks. However, recent studies reveal that GNNs are vulnerable to adversarial attacks, i.e. an attacker is able to fool the GNNs by perturbing the graph structure or node features deliberately. While being able to successfully decrease the performance of GNNs, most existing attacking algorithms require access to either the model parameters or the training data, which is not practical in the real world. In this paper, we develop deeper insights into the Mettack algorithm, which is a representative grey-box attacking method, and then we propose a gradient-based black-box attacking algorithm. Firstly, we show that the Mettack algorithm will perturb the edges unevenly, thus the attack will be highly dependent on a specific training set. As a result, a simple yet useful strategy to defense against Mettack is to train the GNN with the validation set. Secondly, to overcome the drawbacks, we propose the Black-Box Gradient Attack (BBGA) algorithm. Extensive experiments demonstrate that out proposed method is able to achieve stable attack performance without accessing the training sets of the GNNs. Further results shows that our proposed method is also applicable when attacking against various defense methods.
연구 동기 및 목표
- 기존 회색 상자 공격인 Mettack가 훈련 세트 정보에 크게 의존하고, 교란 분포가 불균형한 점의 한계를 조사하기 위해.
- 모델 파라미터, 훈련 데이터, 또는 쿼리 기반 피드백에 접근할 수 없는 블랙박스 공격 방법을 개발하여 실질적인 적대적 공격를 가능하게 하기 위해.
- 스펙트럴 클러스터링에서 유도된 가짜 레이블을 사용해 서로서모델 훈련 전략을 설계하여, 블랙박스 환경에서 기울기 기반 최적화를 가능하게 하기 위해.
- GCN-Jaccard, R-GCN, Pro-GNN와 같은 다양한 방어 기법에 대해 BBGA의 강건성을 평가하기 위해.
- 훈련 데이터에 대한 의존도와 적대적 교란의 공간 분포를 분석함으로써 GNN의 취약성에 대한 깊이 있는 통찰을 제공하기 위해.
제안 방법
- 고정된 감마 파라미터(γ = 0.001)를 사용한 스펙트럴 클러스터링을 적용해 노드를 k개의 클러스터로 그룹화함으로써, 진정한 레이블이 없이도 가짜 레이블 생성이 가능하다.
- 메타기울기 계산을 위해 파artitions를 선택하는 데 k-폴드 그리디 전략을 적용하여, 그래프 전반에 걸쳐 다양하고 효과적인 교란 방향을 확보한다.
- 진짜 레이블이 없이도 기울기 기반 최적화를 가능하게 하기 위해, 가짜 레이블 데이터에 기반한 서로서모델을 훈련시켜, 구조적 교란을 위한 기울기 근사치를 도출한다.
- 기울기 업데이트 과정에서 변동성이 낮은 노드 쌍을 제거하는 필터링 메커니즘을 도입하여, 공격의 효율성과 안정성을 향상시킨다.
- 다양한 파artitions의 기울기를 통합하는 메타기울기 업데이트 규칙을 도입하여, 교란 분포의 균일성을 확보하고, 엣지 수정을 이끌어낸다.
- T=100회 반복과 η=0.01를 사용한 교란 비율 제어 메커니즘을 도입하여, 공격 강도와 모델 일반화 능력 간의 균형을 확보한다.
실험 결과
연구 질문
- RQ1기존의 메타박스 공격인 Mettack는 그래프 전반에 걸쳐 교란을 어떻게 분포시키는가? 그리고 그 불균형성의 함의는 무엇인가?
- RQ2훈련 데이터, 모델 파라미터, 또는 쿼리 기반 피드백에 접근할 수 없는 기울기 기반 블랙박스 공격를 개발할 수 있는가?
- RQ3스펙트럴 클러스터링에서 유도된 가짜 레이블을 사용하면, 블랙박스 공격를 위한 효과적인 서로서모델 훈련이 가능한가?
- RQ4제안된 BBGA 방법은 GCN-Jaccard, R-GCN, Pro-GNN와 같은 다양한 방어 기법에 대해 어떻게 성능을 발휘하는가?
- RQ5k(파artitions 수)와 변동성이 낮은 엣지를 필터링하는 것과 같은 핵심 하이퍼파라미터가 공격 성능에 미치는 영향은 무엇인가?
주요 결과
- Mettack 공격는 훈련 세트 근처에서 교란이 더 농축되어 불균형한 교란 분포를 보이며, 특정 훈련 분할에 크게 의존한다.
- 검증 세트만으로 GNN을 훈련시키면 Mettack에 대한 강건성이 크게 향상되며, 단순하면서도 효과적인 방어 전략임을 입증한다.
- 원본 GCN 모델을 공격할 때, 여러 실험 설정에서 BBGA는 기준 방법들보다 20% 높은 오분류율을 달성한다.
- Cora, Citeseer, Cora-ML 데이터셋에서, 깨끗한 모델뿐 아니라 R-GCN과 Pro-GNN와 같은 방어 모델을 공격할 때도 BBGA는 모든 기준 방법들을 능가한다.
- 제거 분석 결과, k-폴드 그리디 선택과 변동성이 낮은 노드 쌍의 필터링이 모두 높은 공격 성능을 위해 필수적임을 확인했다.
- 하이퍼파라미터 분석 결과, 공격 성능는 k가 일정 수준까지 증가함에 따라 향상되며, k=5가 성능과 훈련 시간 간의 최적의 균형을 이룬다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.