Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Deepening Graph Neural Networks: A GNTK-based Optimization Perspective

Wei Huang, Yayong Li|arXiv (Cornell University)|2021. 03. 03.
Advanced Graph Neural Networks참고 문헌 43인용 수 7
한 줄 요약

이 논문은 GNTK 기반 최적화 관점에서 깊은 그래프 신경망(GNNs)에서의 학습 가능성 붕괴를 설명하며, 초광역 GCN이 깊이에 따라 기하급수적으로 학습 가능성 감소를 겪는다는 것을 드러낸다. 이를 바탕으로 GNTK 다양성을 유지함으로써 이 감소를 완화하는 그래프 적응형 샘플링 방법인 Critical DropEdge를 제안하며, 다양한 벤치마크에서 깊은 GNN의 학습 성능을 크게 향상시킨다.

ABSTRACT

Graph convolutional networks (GCNs) and their variants have achieved great success in dealing with graph-structured data. Nevertheless, it is well known that deep GCNs suffer from the over-smoothing problem, where node representations tend to be indistinguishable as more layers are stacked up. The theoretical research to date on deep GCNs has focused primarily on expressive power rather than trainability, an optimization perspective. Compared to expressivity, trainability attempts to address a more fundamental question: Given a sufficiently expressive space of models, can we successfully find a good solution via gradient descent-based optimizers? This work fills this gap by exploiting the Graph Neural Tangent Kernel (GNTK), which governs the optimization trajectory under gradient descent for wide GCNs. We formulate the asymptotic behaviors of GNTK in the large depth, which enables us to reveal the dropping trainability of wide and deep GCNs at an exponential rate in the optimization process. Additionally, we extend our theoretical framework to analyze residual connection-based techniques, which are found to be merely able to mitigate the exponential decay of trainability mildly. Inspired by our theoretical insights on trainability, we propose Critical DropEdge, a connectivity-aware and graph-adaptive sampling method, to alleviate the exponential decay problem more fundamentally. Experimental evaluation consistently confirms using our proposed method can achieve better results compared to relevant counterparts with both infinite-width and finite-width.

연구 동기 및 목표

  • 깊은 GCN이 이론적으로 표현 가능성이 있음에도 불구하고 학습이 안 되는 이유에 대한 근본적 이해 격차를 해소하기 위해.
  • 초광역 GCN의 최적화 역학을 대칭 깊이 극한에서 그래프 신경장자탄자 커널(GNTK)을 사용해 분석하기 위해.
  • 잔차 연결이 깊은 GNN에서의 학습 가능성 붕괴를 효과적으로 완화할 수 있는지 조사하기 위해.
  • GNTK 다양성을 유지함으로써 기하급수적 학습 가능성 감소를 근본적으로 완화하는 새로운 샘플링 방법인 Critical DropEdge를 설계하기 위해.

제안 방법

  • 초광역 GCN에서 GNTK 행렬의 대칭 깊이 점점 가까운 행동을 이론적으로 분석하여, 모든 요소가 동일한 값으로 기하급수적으로 수렴함을 보여준다.
  • 깊은 GCN에서 GNTK의 특이한 극한을 유도하여, 경사 하강법 하에서 기하급수적 학습 가능성 붕괴가 발생함을 암시한다.
  • 잔차 연결 기반 GCN에 대한 이론적 분석을 확장하여, 학습 가능성 감소가 오직 약간만 느려짐을 보여준다.
  • GNTK 다양성을 유지하고 기하급수적으로 동일한 값으로 수렴하는 것을 방지하기 위해, 연결성 인식형이고 그래프 적응형인 엣지 샘플링 전략인 Critical DropEdge를 설계한다.
  • Cora, Citeseer, PubMed, Physics 데이터셋에서 GNTK 수렴 곡선과 학습 손실 궤적을 사용한 실증적 검증을 수행한다.
  • 16층 및 32층 모델에서 표준 GCN, DropEdge, C-DropEdge 간의 학습 역학을 비교하여 수렴 속도와 최종 손실을 평가한다.

실험 결과

연구 질문

  • RQ1초광역 GCN에서 대칭 깊이 극한에서 그래프 신경장자탄자 커널(GNTK)이 기하급수적으로 특이 행렬로 수렴하는가?
  • RQ2잔차 연결은 GNTK의 기하급수적 감소를 어느 정도 완화하여 깊은 GCN의 학습 가능성을 향상시킬 수 있는가?
  • RQ3Graph-adaptive 엣지 샘플링 방법인 Critical DropEdge가 깊은 GCN에서 관찰된 기하급수적 학습 가능성 붕괴를 근본적으로 뒤집을 수 있는가?
  • RQ4수렴 속도와 최종 성능 측면에서, GNTK 기반 최적화 행동이 표준 GCN, DropEdge, C-DropEdge 간에 어떻게 다를까?

주요 결과

  • 초광역 GCN의 GNTK 행렬은 대칭 깊이 극한에서 기하급수적으로 특이 행렬로 수렴하여 기하급수적 학습 가능성 붕괴를 유발한다.
  • 잔차 연결은 GNTK의 기하급수적 감소를 오직 약간만 늦추며, 깊은 GCN에서의 학습 가능성 붕괴를 방지하지 못한다.
  • Critical DropEdge는 효과적으로 GNTK 다양성을 유지하여 기하급수적 수렴을 방지하고 깊은 GCN의 안정적 학습을 가능하게 한다.
  • Cora에서 16층 GCN에 C-DropEdge를 적용한 결과 정확도가 58.5±3.9%를 기록하여, 표준 GCN(36.3±13.8%)과 DropEdge(55.1±5.2%)를 능가했다.
  • Citeseer에서 32층 GCN에 C-DropEdge를 적용한 결과 정확도가 24.7±1.8%를 기록하여, 표준 GCN(20.1±2.4%)과 DropEdge(22.1±2.0%)보다 뚜렷이 우수했다.
  • Physics에서 32층 GCN에 C-DropEdge를 적용한 결과 정확도가 36.2±8.4%를 기록하여, 표준 GCN(28.8±9.4%)과 DropEdge(31.1±8.8%)를 능가했으며, C-DropEdge는 깊은 모델에서 발생하는 OOM 문제를 피했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.