Skip to main content
QUICK REVIEW

[논문 리뷰] Are More Layers Beneficial to Graph Transformers?

Haiteng Zhao, Shuming Ma|arXiv (Cornell University)|2023. 03. 01.
Advanced Graph Neural Networks인용 수 5
한 줄 요약

이 논문은 깊이가 증가하는 그래프 트랜스포머가 중요한 부분 구조에서 점점 줄어드는 주의력 용량으로 인해 12층을 초과하면 성능 저하를 겪는다는 점을 규명한다. 이를 해결하기 위해 저자들은 부분 구조 토큰과 국소 주의력을 도입하는 DeepGraph 모델을 제안하여 부분 구조 집중력과 표현력의 향상을 이루었으며, 깊이가 깊은 아키텍처(최대 48층)를 사용하여 그래프 벤치마크에서 최신 기술 성능(SOTA)을 달성하였다.

ABSTRACT

Despite that going deep has proven successful in many neural architectures, the existing graph transformers are relatively shallow. In this work, we explore whether more layers are beneficial to graph transformers, and find that current graph transformers suffer from the bottleneck of improving performance by increasing depth. Our further analysis reveals the reason is that deep graph transformers are limited by the vanishing capacity of global attention, restricting the graph transformer from focusing on the critical substructure and obtaining expressive features. To this end, we propose a novel graph transformer model named DeepGraph that explicitly employs substructure tokens in the encoded representation, and applies local attention on related nodes to obtain substructure based attention encoding. Our model enhances the ability of the global attention to focus on substructures and promotes the expressiveness of the representations, addressing the limitation of self-attention as the graph transformer deepens. Experiments show that our method unblocks the depth limitation of graph transformers and results in state-of-the-art performance across various graph benchmarks with deeper models.

연구 동기 및 목표

  • 비교적 깊은 NLP 및 비전 트랜스포머에서 관찰된 바와 같이 그래프 트랜스포머의 깊이 증가가 성능 향상에 기여하는지 조사한다.
  • 특히 부분 구조에서 주의력 용량이 감소하는 것을 포함한 깊이가 증가하는 그래프 트랜스포머에서 성능 저하의 근본 원인을 규명한다.
  • 깊은 아키텍처에서 중요한 부분 구조를 집중적으로 다룰 수 있도록 모델의 능력을 향상시켜 이에 따른 성능 저하의 근본 원인을 해결한다.
  • 모델 깊이 증가에 따라 주의력 용량과 표현력의 유지가 가능한 확장성 있고 효과적인 방법을 설계한다.

제안 방법

  • 모델의 입력 표현에 포함된 국소 그래프 부분 구조(예: 고리, 클리크 등)를 명시적으로 표현하기 위해 전용 부분 구조 토큰을 도입한다.
  • 동일한 부분 구조에 속한 노드들에 대해 국소 자기 주의력을 적용하여 국소적인 구조 패턴에 집중된 주의력을 가능하게 한다.
  • 전역 자기 주의력과 부분 구조 기반 주의력을 통합하여 장거리 의존성 모델링을 유지하면서 국소 특징 학습을 강화한다.
  • 매우 깊은 모델(최대 48층)의 훈련을 안정화시키기 위해 deepnorm 잔차 연결을 사용한다.
  • 두 단계 훈련 전략을 적용: 기하학적 또는 이웃 특징을 사용해 부분 구조 토큰을 사전 훈련한 후, 엔드 투 엔드로 미세조정한다.
  • 주의력 용량과 표현 노름을 정규화하여 각 층 간에 안정적이고 해석 가능한 부분 구조 인코딩을 보장한다.

실험 결과

연구 질문

  • RQ1그래프 트랜스포머의 깊이를 증가시키면 그래프 학습 작업에서 성능 향상이 이루어지는가?
  • RQ2기존 그래프 트랜스포머는 왜 12층을 초과하면 성능 향상에 기여하지 못하는가?
  • RQ3모델 깊이가 증가함에 따라 부분 구조에서의 주의력 용량은 어떻게 감소하는가?
  • RQ4명시적인 부분 구조 인코딩과 국소 주의 메커니즘을 통해 깊이가 깊은 그래프 트랜스포머에서 주의력 용량을 복원하고 표현력의 향상을 이룰 수 있는가?
  • RQ5제안된 방법은 더 깊은 모델을 사용하여 표준 그래프 벤치마크에서 최신 기술 성능을 달성할 수 있는가?

주요 결과

  • 12층을 초과하는 그래프 트랜스포머는 ZINC과 CLUSTER에서 얕은 기준 모델보다 성능 저하를 보이며 성능 저하의 한계를 보인다.
  • 깊이가 증가함에 따라 부분 구조에서의 주의력 용량이 심각하게 감소하여 모델이 중요한 구조 패턴을 학습하고 집중하는 능력이 떨어진다.
  • DeepGraph는 48층 모델을 사용하여 ZINC(테스트 손실: 0.072)와 CLUSTER(정확도: 77.912)에서 최신 기술 성능을 달성하여 모든 기준 모델을 압도한다.
  • 제거 실험 결과, 국소 주의력(제거 시 ZINC에서 약 0.01 감소)과 부분 구조 인코딩(제거 시 심한 성능 저하)이 깊은 모델의 성공에 핵심적인 역할을 한다.
  • 노드 수준의 주의력보다 부분 구조 토큰이 훨씬 높은 표현 능력을 보이며, 이는 구조 정보 유지에 기여하는 역할을 검증한다.
  • 모델은 부분 구조 유형에 대해 강건하다: 기하학적 부분 구조(예: 고리)는 이웃 기반 부분 구조보다 더 중요하지만, 둘을 조합하면 최적의 성능을 얻을 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.