Skip to main content
QUICK REVIEW

[논문 리뷰] Old can be Gold: Better Gradient Flow can Make Vanilla-GCNs Great Again

Ajay Jaiswal, Peihao Wang|arXiv (Cornell University)|2022. 10. 14.
Advanced Graph Neural Networks인용 수 4
한 줄 요약

이 논문은 깊이 있는 바닐라-GCN에서 성능 저하의 원인이 과도한 스무딩 외에도 열악한 그래디언트 플로우에 있음을 제안한다. 위상 정보를 반영한 등장치 초기화와 스킵 커넥션을 동적으로 추가하는 그래디언트 유도 동적 리워핑을 도입함으로써, 저자들은 그래디언트 플로우를 크게 향상시켜 핵심 아키텍처의 복잡성 없이도 인용 네트워크에서 최신 기준 성능(SOTA)을 달성할 수 있도록 했다.

ABSTRACT

Despite the enormous success of Graph Convolutional Networks (GCNs) in modeling graph-structured data, most of the current GCNs are shallow due to the notoriously challenging problems of over-smoothening and information squashing along with conventional difficulty caused by vanishing gradients and over-fitting. Previous works have been primarily focused on the study of over-smoothening and over-squashing phenomena in training deep GCNs. Surprisingly, in comparison with CNNs/RNNs, very limited attention has been given to understanding how healthy gradient flow can benefit the trainability of deep GCNs. In this paper, firstly, we provide a new perspective of gradient flow to understand the substandard performance of deep GCNs and hypothesize that by facilitating healthy gradient flow, we can significantly improve their trainability, as well as achieve state-of-the-art (SOTA) level performance from vanilla-GCNs. Next, we argue that blindly adopting the Glorot initialization for GCNs is not optimal, and derive a topology-aware isometric initialization scheme for vanilla-GCNs based on the principles of isometry. Additionally, contrary to ad-hoc addition of skip-connections, we propose to use gradient-guided dynamic rewiring of vanilla-GCNs} with skip connections. Our dynamic rewiring method uses the gradient flow within each layer during training to introduce on-demand skip-connections adaptively. We provide extensive empirical evidence across multiple datasets that our methods improve gradient flow in deep vanilla-GCNs and significantly boost their performance to comfortably compete and outperform many fancy state-of-the-art methods. Codes are available at: https://github.com/VITA-Group/GradientGCN.

연구 동기 및 목표

  • 이론적 표현력은 갖추고 있음에도 깊이 있는 바닐라-GCN이 성능이 떨어지는 이유를 분석하고, 역전파 과정에서의 열악한 그래디언트 플로우에 초점을 맞춘다.
  • 깊은 아키텍처에서 그래디언트 플로우에 악영향을 줄 수 있는 기존의 Glorot 초기화 방식을 도전한다.
  • 층별 그래디언트 플로우를 기반으로 스킵 커넥션을 동적으로 통합하는 원칙적인 방법을 개발하여 학습 가능성을 향상시키는 것.
  • 개선된 그래디언트 플로우 메커니즘을 갖춘 간단한 바닐라-GCN이 최신 기준 성능을 달성할 수 있음을 입증하는 것.

제안 방법

  • 그래프 라플라시안과 차수 정보를 활용해 바닐라-GCN에 대한 위상 정보를 반영한 등장치 초기화를 유도하여 신호 안정성을 층 간에 유지한다.
  • 각 층 내 그래디언트의 p-노름을 지표로 사용해 그래디언트 플로우를 정의함으로써 학습 도중에 잘 학습되지 않는 층을 식별한다.
  • 약한 그래디언트 신호를 가진 층에만 동적으로 스킵 커넥션을 추가하는 그래디언트 유도 동적 리워핑 기법을 제안한다.
  • 기본 아키텍처를 수정하거나 추가 파rameter를 추가하지 않고도 새로운 초기화와 동적 리워핑을 표준 GCN 학습에 통합한다.
  • 임bedding 표현력 측정을 위해 딜리클레 에너지를 프록시로 사용하고, 학습 과정에서 메커니즘이 표현력을 어떻게 유지하는지 추적한다.
  • 표준 GCN 설정과 최신 기준 기반 모델을 사용해 Cora, PubMed, Citeseer 등 여러 데이터셋에서 메서드를 평가한다.

실험 결과

연구 질문

  • RQ1열악한 그래디언트 플로우가 깊이 있는 바닐라-GCN의 학습 가능성과 성능에 심각한 영향을 미치는가?
  • RQ2기존의 Glorot 초기화와 비교해 위상 정보를 반영한 초기화가 바닐라-GCN의 그래디언트 플로우와 성능을 향상시키는가?
  • RQ3그래디언트 플로우 기반으로 동적으로 스킵 커넥션을 통합하는 것이 정적 또는 수작업으로 설정한 스킵 커넥션보다 더 효과적인가?
  • RQ4개선된 그래디언트 플로우 메커니즘을 갖춘 바닐라-GCN이 최신 기준 성능을 달성할 수 있는가?

주요 결과

  • 제안된 위상 정보를 반영한 등장치 초기화 방법은 깊이 있는 바닐라-GCN에서 그래디언트 플로우를 크게 향상시켜 모든 벤치마크 데이터셋에서 빠른 수렴과 향상된 성능을 이끌어냈다.
  • 그래디언트 유도 동적 리워핑은 잘 학습되지 않는 층을 성공적으로 식별하고 강화하여 역전파 과정에서 근사적으로 영향을 받는 층의 수를 줄였다.
  • 개선된 초기화와 동적 리워핑의 조합은 층 간에 딜리클레 에너지를 유지하여 학습 과정에서 임베딩 표현력의 손실를 방지했다.
  • Cora, PubMed, Citeseer에서 제안된 방법은 단지 바닐라-GCN만을 사용함으로써 최신 기준 또는 거의 최신 기준 성능을 달성했으며, 많은 복잡한 GNN 아키텍처를 능가했다.
  • 기존 GCN에서 관찰되는 딜리클레 에너지의 지수 감소를 줄여 깊은 층에서 노드 표현의 다양성과 표현력을 유지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.