Skip to main content
QUICK REVIEW

[논문 리뷰] Sparse Graph Attention Networks

Ye Yang, Shihao Ji|arXiv (Cornell University)|2019. 12. 02.
Advanced Graph Neural Networks참고 문헌 26인용 수 6
한 줄 요약

이 논문은 L₀-노름 정규화를 통해 흐린 또는 관련이 없는 간선을 식별하고 제거함으로써 희소한 주의 계수를 학습하는 희소 그래프 주의 네트워크(SGATs)를 제안한다. 모든 레이어와 헤드에서 단일 주의 계수를 공유함으로써 SGATs는 이질적인 그래프에서 성능을 향상시키고, 동질적인 그래프에서는 정확도를 유지하면서도 간선의 50%-80%를 제거한다.

ABSTRACT

Graph Neural Networks (GNNs) have proved to be an effective representation learning framework for graph-structured data, and have achieved state-of-the-art performance on many practical predictive tasks, such as node classification, link prediction and graph classification. Among the variants of GNNs, Graph Attention Networks (GATs) learn to assign dense attention coefficients over all neighbors of a node for feature aggregation, and improve the performance of many graph learning tasks. However, real-world graphs are often very large and noisy, and GATs are prone to overfitting if not regularized properly. Even worse, the local aggregation mechanism of GATs may fail on disassortative graphs, where nodes within local neighborhood provide more noise than useful information for feature aggregation. In this paper, we propose Sparse Graph Attention Networks (SGATs) that learn sparse attention coefficients under an $L_0$-norm regularization, and the learned sparse attentions are then used for all GNN layers, resulting in an edge-sparsified graph. By doing so, we can identify noisy/task-irrelevant edges, and thus perform feature aggregation on most informative neighbors. Extensive experiments on synthetic and real-world graph learning benchmarks demonstrate the superior performance of SGATs. In particular, SGATs can remove about 50\%-80\% edges from large assortative graphs, while retaining similar classification accuracies. On disassortative graphs, SGATs prune majority of noisy edges and outperform GATs in classification accuracies by significant margins. Furthermore, the removed edges can be interpreted intuitively and quantitatively. To the best of our knowledge, this is the first graph learning algorithm that shows significant redundancies in graphs and edge-sparsified graphs can achieve similar or sometimes higher predictive performances than original graphs.

연구 동기 및 목표

  • 대규모이고 노이즈가 많은 실세계 그래프에서 그래프 주의 네트워크(GATs)의 과적합과 노이즈 민감도 문제를 해결하기 위해.
  • 여러 주의 헤드가 매우 유사한 주의 분포를 생성하는 GATs의 부재를 줄이기 위해.
  • 작업에 관련이 없는 또는 노이즈가 있는 간선을 자동으로 식별하고 제거할 수 있는 그래프 학습 방법을 개발하기 위해.
  • 지역 집합이 이웃 노이즈로 인해 실패하는 이질적인 그래프에서의 성능 향상을 위해.
  • 간선 희소화된 그래프가 원본 그래프와 비교해 유사하거나 더 높은 성능을 달성할 수 있음을 보여주기 위해.

제안 방법

  • 모든 GNN 레이어에서 간선 선택의 희소성을 유도하기 위해 주의 계수에 L₀-노름 정규화를 적용한다.
  • 모든 주의 헤드와 모든 레이어에서 단일 세트의 주의 계수를 공유함으로써 GAT 아키텍처를 단순화한다.
  • 모든 네트워크 전반에서 사용되는 간선당 단일 주의 가중치를 학습함으로써 부재를 줄인다.
  • L₀ 노름의 미분 가능 근사치를 얻기 위해 콘크리트 리파라미터라이제이션 기법을 사용하여 엔드 투 엔드 학습을 가능하게 한다.
  • 간선 제거를 제어하는 희소성 유도 하이퍼파rameter λ를 사용해 확률적 경사 하강법으로 모델을 최적화한다.
  • 유의미한 이웃에 대해서만 특징 집합을 수행하는 GNN 프레임워크에 희소 주의 메커니즘을 통합한다.

실험 결과

연구 질문

  • RQ1L₀-노름 정규화가 그래프 구조 데이터에서 노이즈가 있거나 관련이 없는 간선을 효과적으로 식별하고 제거할 수 있는가?
  • RQ2모든 헤드와 레이어에서 단일 공유 주의 계수를 학습할 경우, 표준 GATs와 비교해 일반화 성능 향상과 과적합 감소에 기여하는가?
  • RQ3간선 희소화된 그래프가 동질적 및 이질적 그래프 양쪽에서 분류 정확도를 유지하거나 향상시킬 수 있는가?
  • RQ4희소성 수준(λ로 제어됨)이 모델 성능과 간선 제거 비율에 어떤 영향을 미치는가?
  • RQ5지역 집합이 해로운 영향을 미치는 이질적 그래프에서 SGAT이 GAT, GCN, GraphSAGE를 능가할 수 있는가?

주요 결과

  • SGATs는 Texas와 Cora와 같은 이질적 그래프에서 GATs와 유사하거나 높은 분류 정확도를 달성하여 이웃 노이즈에 대한 강건성을 입증했다.
  • PPI와 Reddit와 같은 동질적 그래프에서는 SGATs가 간선의 50%-80%를 제거하면서도 유사한 분류 정확도를 유지했다.
  • 최적의 정규화 하이퍼파rameter λ는 PPI의 경우 2e-6, Texas의 경우 5e-3로 확인되어 희소성와 성능 간의 균형을 이룬다.
  • PPI와 Texas에서 주의 헤드 수 K=2가 가장 높은 성능을 보였으며, 이는 K가 높아질수록 과적합 위험이 증가함을 시사한다.
  • t-SNE 시각화 결과, 노이즈가 많은 이질적 그래프인 Texas에서 SGAT은 GAT보다 더 분류 분리 가능한 표현을 학습했다.
  • 대규모 간선을 제거했음에도 불구하고, 특징 저장에 따른 주요 메모리 비용으로 인해 SGAT은 GAT과 비교해 런타임이나 메모리 사용량에 유의미한 감소를 보이지 않았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.