Skip to main content
QUICK REVIEW

[논문 리뷰] Graph Condensation for Graph Neural Networks

Wei Jin, Lingxiao Zhao|arXiv (Cornell University)|2021. 10. 14.
Advanced Graph Neural Networks참고 문헌 47인용 수 20
한 줄 요약

이 논문은 대규모 속성 부여된 그래프를 성능을 유지하면서 매우 작고 합성된 그래프로 압축하는 새로운 프레임워크인 그래프 압축(GCond)을 제안한다. 기울기 일치 손실을 최적화하고 그래프 구조를 학습 가능한 노드 특성의 함수로 파arameter화함으로써, GCond는 그래프 크기를 99.9% 이상 감소시키며, Flickr에서는 원본 테스트 정확도의 99.8%까지 유지하고 Reddit에서는 95.3%를 달성한다. 이는 다양한 GNN 아키텍처의 효율적인 학습을 가능하게 한다.

ABSTRACT

Given the prevalence of large-scale graphs in real-world applications, the storage and time for training neural models have raised increasing concerns. To alleviate the concerns, we propose and study the problem of graph condensation for graph neural networks (GNNs). Specifically, we aim to condense the large, original graph into a small, synthetic and highly-informative graph, such that GNNs trained on the small graph and large graph have comparable performance. We approach the condensation problem by imitating the GNN training trajectory on the original graph through the optimization of a gradient matching loss and design a strategy to condense node futures and structural information simultaneously. Extensive experiments have demonstrated the effectiveness of the proposed framework in condensing different graph datasets into informative smaller graphs. In particular, we are able to approximate the original test accuracy by 95.3% on Reddit, 99.8% on Flickr and 99.0% on Citeseer, while reducing their graph size by more than 99.9%, and the condensed graphs can be used to train various GNN architectures.Code is released at https://github.com/ChandlerBang/GCond.

연구 동기 및 목표

  • 수백만 개의 노드와 간선을 가진 대규모 그래프에서 GNN을 학습할 때 발생하는 증가하는 계산 및 저장 부담을 해결하기 위해.
  • 작고 합성된 그래프를 학습시켜 원본 전체 그래프에서 학습한 것과 유사한 성능을 낼 수 있는지 탐색하기 위해.
  • 하류 GNN 성능을 유지하면서 그래프 구조와 노드 특성을 동시에 압축하는 방법을 개발하기 위해.
  • 매우 정보가 풍부하고 최소한의 합성 그래프를 만들어 효율적인 그래프 데이터의 학습, 저장, 검색을 가능하게 하기 위해.
  • 압축된 그래프가 GCN, GraphSAGE, SGC 등 다양한 GNN 아키텍처와 신경망 아키텍처 탐색(NAS)과 같은 다양한 하류 작업에서 어떻게 일반화되는지 보여주기 위해.

제안 방법

  • 프레임워크는 원본 그래프에서 학습된 GNN의 학습 궤적과 압축된 그래프에서 학습된 GNN의 궤적을 일치시키기 위해 기울기 일치 손실을 사용한다.
  • 압축된 그래프의 그래프 구조는 학습 가능한 노드 특성의 미분 가능한 함수로 파arameter화되어 있으며, 이는 종단 간 최적화를 가능하게 한다.
  • 압축된 그래프의 노드 특성은 학습 중에 최적화되는 자유 매개변수로 간주된다.
  • 이 방법은 합성 노드 특성, 구조(주의 기반 간선 가중치를 통해), 그리고 레이블을 동시에 최적화하여 성능 격차를 최소화한다.
  • 손실은 원본 그래프와 압축된 그래프에서 GNN 매개변수의 기울기 간 L2 거리 측정을 통해 백프로파게이션을 통해 학습된다.
  • 프레임워크는 GCN, GraphSAGE, SGC 등 다양한 GNN 아키텍처를 사용하여 Reddit, Flickr, Citeseer, Cora, Ogbg-arxiv 등의 여러 벤치마크 데이터셋에서 평가된다.

실험 결과

연구 질문

  • RQ1원본 전체 그래프에서 학습한 것과 유사한 성능을 내는 작은 합성 그래프를 학습시킬 수 있는가?
  • RQ2그래프 구조와 노드 특성을 효과적으로 압축하면서 GNN 성능을 유지할 수 있는가?
  • RQ3압축된 그래프가 다양한 GNN 아키텍처와 하이퍼파라미터에 대해 얼마나 잘 일반화되는가?
  • RQ4신경망 아키텍처 탐색(NAS) 환경에서 압축된 그래프에서 학습한 GNN의 성능은 전체 데이터셋에서 학습한 경우와 어떻게 비교되는가?
  • RQ5압축된 그래프는 어떤 구조적 및 통계적 특성을 가지며, 원본 그래프와 어떻게 다를까?

주요 결과

  • GCond는 그래프 크기를 99.9% 이상 감소시키며, Reddit에서는 원본 테스트 정확도의 95.3%, Flickr에서는 99.8%, Citeseer에서는 99.0%를 달성한다.
  • 압축된 그래프는 원본 그래프보다 훨씬 더 조밀한데, Reddit에서는 희소성 비율이 0.09%에서 2.57%로, Ogbg-arxiv에서는 0.01%에서 3.25%로 감소한다.
  • Cora, Citeseer, Flickr에서는 동질성 패턴이 잘 유지되지만, Reddit와 Ogbg-arxiv에서는 감소한 경향을 보인다.
  • Reddit에 대한 압축된 그래프는 별처럼 생긴 구조를 보이며, 이는 노드 특성이 정보 전파에 지배적인 역할을 함을 시사한다.
  • GCN, GraphSAGE, SGC 등 다양한 아키텍처에서 압축된 그래프에서 학습한 GNN은 성능 저하가 최소한이면서 잘 일반화된다.
  • 신경망 아키텍처 탐색(NAS)에서, 압축된 데이터셋에서의 성능과 전체 데이터셋에서의 성능 간에 강한 상관관계가 있으며, 이는 압축된 그래프의 유용성을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.