Skip to main content
QUICK REVIEW

[논문 리뷰] How Neural Networks Extrapolate: From Feedforward to Graph Neural Networks

Keyulu Xu, Mozhi Zhang|arXiv (Cornell University)|2020. 09. 24.
Domain Adaptation and Few-Shot Learning참고 문헌 90인용 수 108
한 줄 요약

본 논문은 경사하강법으로 학습된 신경망이 학습 데이터 밖으로 외삽하는 방식을 분석하고, ReLU MLP가 원점에서의 방향으로 선형 함수로 수렴하며 GNN이 작업 특유의 비선형성이 아키텍처나 특징에 인코딩될 때 외삽할 수 있음을 보여준다. 또한 NTK 기반 이론적 결과와 DP 과제들에 걸친 실증 검증을 제공한다.

ABSTRACT

We study how neural networks trained by gradient descent extrapolate, i.e., what they learn outside the support of the training distribution. Previous works report mixed empirical results when extrapolating with neural networks: while feedforward neural networks, a.k.a. multilayer perceptrons (MLPs), do not extrapolate well in certain simple tasks, Graph Neural Networks (GNNs) -- structured networks with MLP modules -- have shown some success in more complex tasks. Working towards a theoretical explanation, we identify conditions under which MLPs and GNNs extrapolate well. First, we quantify the observation that ReLU MLPs quickly converge to linear functions along any direction from the origin, which implies that ReLU MLPs do not extrapolate most nonlinear functions. But, they can provably learn a linear target function when the training distribution is sufficiently "diverse". Second, in connection to analyzing the successes and limitations of GNNs, these results suggest a hypothesis for which we provide theoretical and empirical evidence: the success of GNNs in extrapolating algorithmic tasks to new data (e.g., larger graphs or edge weights) relies on encoding task-specific non-linearities in the architecture or features. Our theoretical analysis builds on a connection of over-parameterized networks to the neural tangent kernel. Empirically, our theory holds across different training settings.

연구 동기 및 목표

  • 경사하강법으로 학습된 신경망이 학습 지원 밖으로 외삽하는 정도를 정량화한다.
  • MLP가 비선형 외삽에서 어려움을 겪는 이유를 설명하고, DP 유사한 과제에서 GNN이 성공할 수 있는 이유를 설명한다.
  • MLP와 GNN가 잘 외삽하는 조건을 식별한다.
  • 피드포워드 외삽에 대한 통찰을 GNN 아키텍처와 표현에 연계한다.

제안 방법

  • NTK 영역에서 과다매개변수화된 네트워크를 분석하여 학습 역학과 커널 회귀를 연결한다.
  • 원점에서의 방향으로 두 계층 ReLU MLP의 선형 외삽 거동을 O(1/t) 속도로 증명한다.
  • 학습 분포가 충분히 다양할 때 MLP가 선형 타깃을 잘 외삽한다를 보인다(정리 2).
  • 작업 특유의 비선형성이 아키텍처나 입력 표현에 인코딩될 때 GNN이 잘 외삽한다는 가설을 제시하고 검증한다(정리 3 및 동반 실험).
  • 단순화된 GNN 케이스에서 외삽을 분석하기 위해 그래프 NTK를 사용하고 최대 차수, 최단 경로, n-바디 과제에서 검증한다.
  • 외삽 가능성에 있어 아키텍처(예: 최대/최소 리드아웃)와 입력 표현의 역할을 논의한다.

실험 결과

연구 질문

  • RQ1경사하강법으로 학습된 ReLU MLP가 학습 분포를 넘어 얼마나 잘 외삽하는가?
  • RQ2어떤 조건에서 GNN이 비선형 과제를 외삽할 수 있으며, 아키텍처와 입력 표현이 이것에 어떤 영향을 미치는가?
  • RQ3GNN이나 표현에 작업 특유의 비선형성을 인코딩하는 것이 보지 못한 그래프 크기, 구조, 혹은 간선 가중치까지 외삽을 가능하게 하는가?
  • RQ4학습 데이터의 기하학적 구조가 MLP의 선형 타깃 외삽 및 GNN의 DP 유사 작업에서의 외삽에 어떤 영향을 미치는가?

주요 결과

  • ReLU MLP는 원점으로부터의 방향을 따라 선형 함수로 외삽하며 속도는 O(1/t)다.
  • 학습 분포가 충분한 방향(다양한 기하)을 포함하면 MLP가 선형 타깃 함수를 외삽할 수 있다.
  • 그래프 NTK 이론과 실험에 의해 뒷받침되며, 아키텍처나 특징에 적절한 비선형성이 인코딩되면 DP 유사 과제에서 GNN이 잘 외삽할 수 있다.
  • 합 집계(sum-aggregation)을 DP 업데이트를 모방하는 아키텍처로 교체(예: 최소/최대 리드)하면 최대 차수나 최단 경로와 같은 과제에서 더 나은 외삽이 가능하다.
  • 향상된 입력 표현은 비선형 동역학(n-바디 등)을 MLP가 아닌 표현에 비선형성을 옮김으로써 GNN이 외삽하도록 할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.