Skip to main content
QUICK REVIEW

[논문 리뷰] On Positional and Structural Node Features for Graph Neural Networks on Non-attributed Graphs

Hejie Cui, Zijie Lu|arXiv (Cornell University)|2021. 07. 03.
Advanced Graph Neural Networks참고 문헌 52인용 수 9
한 줄 요약

이 논문은 비속성 그래프에서 그래프 신경망(GNN)에 대한 인공 노드 특징을 조사하며, 이를 위치적 및 구조적 유형으로 분류한다. 10개의 벤치마크 데이터셋에서 광범위한 실험을 통해 위치적 특징이 위치 기반 노드 분류에서 뛰어난 성능을 보이며, 구조적 특징이 구조적 노드 분류 및 그래프 분류에서 뛰어난 성능을 보인다. 특히 새로운 '도수 버킷 범위 초기화' 방법을 통해 최신 기술 수준의 성능을 달성하였으며, 일부 경우에서는 실제 특징을 사용하는 모델를 초월하기도 한다.

ABSTRACT

Graph neural networks (GNNs) have been widely used in various graph-related problems such as node classification and graph classification, where superior performance is mainly established when natural node features are available. However, it is not well understood how GNNs work without natural node features, especially regarding the various ways to construct artificial ones. In this paper, we point out the two types of artificial node features, i.e., positional and structural node features, and provide insights on why each of them is more appropriate for certain tasks, i.e., positional node classification, structural node classification, and graph classification. Extensive experimental results on 10 benchmark datasets validate our insights, thus leading to a practical guideline on the choices between different artificial node features for GNNs on non-attributed graphs. The code is available at https://github.com/zjzijielu/gnn-positional-structural-node-features.

연구 동기 및 목표

  • 자연적 노드 특징이 없는 비속성 그래프에서 인공 노드 특징이 GNN 성능에 미치는 영향을 이해하는 것.
  • 정보 내용과 유용성 기반으로 일반적인 인공 노드 특징을 위치적 및 구조적 유형으로 분류하는 것.
  • 하류 과제 요구사항에 기반한 적절한 인공 노드 특징 선택을 위한 경험적 통찰과 실용적 가이드라인을 제공하는 것.
  • 다양한 초기화 방법의 성능을 여러 그래프 마이닝 과제와 데이터셋에서 평가하는 것.

제안 방법

  • 저자는 그래프 정보를 인코딩하는 방식에 따라 인공 노드 특징을 두 유형으로 분류한다: 위치적(예: 위치 기반, DeepWalk) 및 구조적(예: 도수, PageRank, 고유값).
  • 10개의 벤치마크 데이터셋에서 세 가지 과제를 대상으로 여덟 가지 일반적인 초기화 방법(랜덤, 원핫, 도수, PageRank, 고유값, DeepWalk, 공유, 도수 버킷 범위)을 평가한다.
  • 각 과제에 대해, 표준 프rotocol를 따르며 GNN(특히 GraphSAGE)를 사용하고, 평균 및 합산 집약 방식을 적용하여 공정한 비교를 보장한다.
  • 노드를 도수 범위에 따라 그룹화하여 구조적 계층을 더 잘 인코딩할 수 있도록 하는 새로운 도수 기반 초기화 방법인 '도수 버킷 범위'를 제안한다.
  • 세 가지 유형의 과제에서 실험을 수행한다: 위치 기반 노드 분류, 구조적 노드 분류, 그래프 분류이며, 성능은 정확도로 측정된다.
  • MUTAG, PROTEINS, IMDB-BINARY, IMDB-MULTI 등 다양한 데이터셋을 포함한 일관된 평가 프레임워크를 사용하며, 5겹 교차 검증과 표준편차 보고를 수행한다.

실험 결과

연구 질문

  • RQ1위치 기반 노드 분류 과제에서 위치적 특징과 구조적 특징 중 어떤 것이 더 뛰어난 성능을 낼 수 있는가?
  • RQ2다양한 인공 노드 특징이 구조적 노드 분류 및 그래프 분류 과제에 어떤 영향을 미치는가?
  • RQ3잘 설계된 인공 노드 특징이 특정 상황에서는 실제 노드 특징을 사용하는 모델를 초월할 수 있는가?
  • RQ4인공 특징을 사용할 때, 집약 방식(평균 대비 합산)의 상대적 기여도는 어떻게 되는가?
  • RQ5새로운 '도수 버킷 범위' 초기화 방법은 기존 방법과 비교해 성능 및 일반화 능력 측면에서 어떻게 비교되는가?

주요 결과

  • 도수 버킷 범위 초기화 방법은 구조적 노드 분류 과제에서 최신 기술 수준의 성능을 달성하였으며, 표준 도수 및 기타 베이스라인을 초월한다.
  • 그래프 분류 과제에서, 합산 집약을 사용하는 도수 특징을 가진 GNN은 MUTAG에서 84.4%의 정확도를 기록했고, IMDB-BINARY에서는 69.7%를 기록하여 실제 특징을 사용하는 모델(71.4% on MUTAG)의 성능을 뛰어넘었다.
  • PROTEINS에서는 PageRank와 합산 집약이 IMDB-BINARY에서 70.3%의 정확도를 기록하였으며, PROTEINS의 실제 특징 기반 베이스라인(67.8%)을 초월하였다.
  • 합산 집약은 항상 평균 집약보다 그래프 분류 과제에서 뛰어난 성능을 보였으며, 이는 이웃의 개수 정보를 더 잘 유지하기 때문이다.
  • 모든 그래프 분류 데이터셋에서 구조적 노드 특징, 특히 PageRank와 도수 기반 방법이 위치적 특징을 일관되게 뛰어넘었다.
  • 자연적 노드 특징이 없는 상황에서도 철저히 설계된 인공 특징은 특정 설정에서 실제 특징을 사용하는 모델의 성능을 초월할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.