Skip to main content
QUICK REVIEW

[논문 리뷰] Graph Neural Networks are Inherently Good Generalizers: Insights by Bridging GNNs and MLPs

Chenxiao Yang, Qitian Wu|arXiv (Cornell University)|2022. 12. 18.
Advanced Graph Neural Networks인용 수 16
한 줄 요약

이 논문은 표준 MLP와 유사하게 학습하지만 추론 시 메시지 전파를 적용하는 새로운 모델 계열인 전파형 MLP(PMLP)를 소개한다. 이는 GNN 아키텍처를 모방한다. 주요 발견은 PMLP가 노드 분류에서 항상 MLP나 GNN보다 뛰어나거나 이를 능가한다는 점이며, 이는 GNN의 우월한 일반화 능력이 학습 동역학 때문이 아니라 추론 시 메시지 전파의 내재된 인덕티브 바이어스 때문임을 드러내며, GNN의 일반화 능력에 대한 이해를 근본적으로 재구성한다.

ABSTRACT

Graph neural networks (GNNs), as the de-facto model class for representation learning on graphs, are built upon the multi-layer perceptrons (MLP) architecture with additional message passing layers to allow features to flow across nodes. While conventional wisdom commonly attributes the success of GNNs to their advanced expressivity, we conjecture that this is not the main cause of GNNs' superiority in node-level prediction tasks. This paper pinpoints the major source of GNNs' performance gain to their intrinsic generalization capability, by introducing an intermediate model class dubbed as P(ropagational)MLP, which is identical to standard MLP in training, but then adopts GNN's architecture in testing. Intriguingly, we observe that PMLPs consistently perform on par with (or even exceed) their GNN counterparts, while being much more efficient in training. This finding sheds new insights into understanding the learning behavior of GNNs, and can be used as an analytic tool for dissecting various GNN-related research problems. As an initial step to analyze the inherent generalizability of GNNs, we show the essential difference between MLP and PMLP at infinite-width limit lies in the NTK feature map in the post-training stage. Moreover, by examining their extrapolation behavior, we find that though many GNNs and their PMLP counterparts cannot extrapolate non-linear functions for extremely out-of-distribution samples, they have greater potential to generalize to testing samples near the training data range as natural advantages of GNN architectures.

연구 동기 및 목표

  • GNN이 MLP보다 일반화 성능이 뛰어나지 않는 이유가 아키텍처인지 학습 과정인지 조사하기.
  • 학습과 추론 아키텍처를 분리하여 GNN의 성능에서 메시지 전파의 역할을 분리 분석하기.
  • 기존의 GNN 성공 요인이 표현력 향상 때문이라는 전통적 믿음을 도전하고, 추론 시 인덕티브 바이어스가 주요 원인임을 제시하기.
  • GNN 행동 분석 및 그래프 신경망의 일반화를 이해하기 위한 새로운 분석 프레임워크인 PMLP 제공하기.

제안 방법

  • 표준 MLP 학습 방식(동일한 아키텍처, 데이터, 손실 함수, 옵티마이저)을 사용하지만 추론 시 비파rametric 메시지 전파 레이어를 적용하는 PMLP 모델 도입.
  • 그래프 구조 데이터에서 표준 MLP를 학습한 후, 테스트 시 GNN 방식의 메시지 전파를 적용하여 PMLP를 구성.
  • 여러 벤치마크와 아키텍처 변형에서 PMLP의 성능을 기존 MLP 및 전체 GNN과 비교.
  • PMLP와 MLP의 무한한 너비 근사에서의 NTK(Neural Tangent Kernel) 특징 맵을 분석하여 학습 후 차이를 규명.
  • 특히 학습 데이터 지원 영역 근처에서 분포 이탈 상황에서의 일반화 및 외삽 성능 분석.
  • t-SNE 시각화를 활용해 MLP, PMLP, GNN이 학습한 내부 노드 표현을 비교하고, 클래스 간 분리도 평가.

실험 결과

연구 질문

  • RQ1GNN의 메시지 전파 메커니즘이 학습 동역학과 무관하게 일반화를 향상시키는가?
  • RQ2MLP로 학습한 모델이 추론 시 메시지 전파를 적용하는 PMLP가 전체 GNN과 유사한 성능을 내는가?
  • RQ3GNN이 MLP보다 일반화 성능에서 우월한 주된 원인은 표현력 능력인가, 아니면 추론 시 인덕티브 바이어스인가?
  • RQ4특히 학습 분포 근처에서 PMLP와 GNN이 외부 분포 샘플로의 외삽 능력에서 어떻게 다를까?
  • RQ5무한한 너비에서 PMLP와 MLP의 NTK 특징 맵은 어떻게 다를까? 이는 일반화와 어떤 관련이 있는가?

주요 결과

  • PMLP는 동일한 학습 가중치를 공유함에도 불구하고 테스트 정확도에서 항상 기존 MLP를 능가하며, 이는 추론 시 메시지 전파가 일반화를 내재적으로 향상시킨다는 것을 시사한다.
  • 노이즈가 있거나 그래프가 희소한 환경에서도 PMLP는 해당되는 GNN과 동일하거나 더 뛰어난 성능을 보이며, 특히 노드 분류에서 뛰어난 성능을 나타낸다.
  • PMLP의 일반화 갭은 MLP보다 크게 작아, GNN 아키텍처의 추론 시 인덕티브 바이어스가 과적합을 줄이는 데 기여함을 입증한다.
  • 무한한 너비 근사에서 PMLP의 NTK 특징 맵은 MLP와 다름을 보이며, 이는 메시지 전파 메커니즘과 관련된 구조적 차이를 드러낸다.
  • PMLP와 GNN은 모두 학습 분포 근처에서 부드러운 전이와 더 나은 일반화를 보이며, 반면 MLP는 지원 영역 외부에서 급격히 선형화된다.
  • t-SNE 시각화 결과, PMLP와 GNN은 MLP보다 더 구분력 있고 클래스 간 분리도가 높은 노드 표현을 학습함을 확인했으며, 이는 PMLP가 학습 시 MLP와 동일한 가중치를 사용함에도 불구하고 성립한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.