Skip to main content
QUICK REVIEW

[논문 리뷰] Data Augmentation View on Graph Convolutional Network and the Proposal of Monte Carlo Graph Learning

Hande Dong, Zhaolin Ding|arXiv (Cornell University)|2020. 06. 23.
Advanced Graph Neural Networks참고 문헌 24인용 수 4
한 줄 요약

이 논문은 레이블 공간에서의 데이터 증강을 통해 그래프 컬러션 네트워크(GCNs)를 해석하는 새로운 그래프 학습 프레임워크인 몬테카를로 그래프 학습(MCGL)을 제안한다. 몬테카를로 샘플링을 통해 그래프 구조를 거쳐 훈련 레이블을 전파함으로써 MCGL은 훈련 세트를 확장하고 기존 분류기들을 훈련시킨다. 이는 비선형 경계 또는 커뮤니티 구조를 가진 청소된 그래프에서 뛰어난 성능을 보이며, GCN보다 그래프 노이즈에 더 민감한 편이다.

ABSTRACT

Today, there are two major understandings for graph convolutional networks, i.e., in the spectral and spatial domain. But both lack transparency. In this work, we introduce a new understanding for it -- data augmentation, which is more transparent than the previous understandings. Inspired by it, we propose a new graph learning paradigm -- Monte Carlo Graph Learning (MCGL). The core idea of MCGL contains: (1) Data augmentation: propagate the labels of the training set through the graph structure and expand the training set; (2) Model training: use the expanded training set to train traditional classifiers. We use synthetic datasets to compare the strengths of MCGL and graph convolutional operation on clean graphs. In addition, we show that MCGL's tolerance to graph structure noise is weaker than GCN on noisy graphs (four real-world datasets). Moreover, inspired by MCGL, we re-analyze the reasons why the performance of GCN becomes worse when deepened too much: rather than the mainstream view of over-smoothing, we argue that the main reason is the graph structure noise, and experimentally verify our view. The code is available at https://github.com/DongHande/MCGL.

연구 동기 및 목표

  • 데이터 증강의 관점에서 그래프 컬러션 네트워크(GCNs)에 대한 새로운 투명한 해석을 제공하기 위해.
  • GCN의 스펙트럼 및 스페이셜 도메인 해석에서의 해석 불가능성 문제를 해결하기 위해.
  • 레이블 공간에서 허위 레이블 전파를 통해 작동하는 새로운 그래프 학습 프레임워크인 몬테카를로 그래프 학습(MCGL)을 제안하기 위해.
  • MCGL과 GCN 간의 구조적 노이즈에 대한 내성과 다양한 데이터 특성에서의 성능 간의 상충 관계를 조사하기 위해.
  • GCN의 깊이 증가에 따른 성능 저하 원인 재평가를 통해, 이는 과도한 스무딩이 아니라 구조적 노이즈 때문임을 주장하기 위해.

제안 방법

  • MCGL은 훈련 노드에서 K단계 몬테카를로 샘플링을 수행하고, 이들의 레이블을 샘플된 이웃 노드로 전파하여 허위 레이블이 부여된 훈련 샘플을 생성한다.
  • 원본 및 허위 레이블이 부여된 노드로 구성된 확장된 훈련 세트를 사용하여 기본 분류기(예: MLP, SVM, LR)를 훈련시킨다.
  • 이 방법은 국소 균질성 가정에 의존한다: 연결된 노드는 동일한 레이블을 가질 가능성이 높으며, 이는 레이블 전파가 타당하다는 것을 의미한다.
  • 레이블 전파를 K단계로 제한하여 먼 거리의 또는 노이즈가 있는 이웃 노드에 대한 과도한 신뢰를 방지하고, 잘못된 허위 레이블 부여를 방지한다.
  • 핵심 메커니즘은 그래프 구조를 레이블 공간에서의 데이터 증강 도구로 간주하는 것으로, GCN의 표현 공간 증강 방식과 대비된다.
  • MCGL은 다양한 노이즈 수준에서 GCN과의 성능 및 내성 비교를 위해 합성 및 실세계 데이터셋에서 평가된다.

실험 결과

연구 질문

  • RQ1그래프 컬러션 연산은 레이블 공간에서의 데이터 증강 형태로 의미적으로 해석될 수 있는가?
  • RQ2비선형 결정 경계 또는 커뮤니티 구조를 가진 청소된 그래프에서 MCGL은 GCN과 비교해 성능가 어떻게 다른가?
  • RQ3GCN의 성능 저하가 깊이 증가에 따라 발생하는 이유는 무엇이며, 이는 주로 과도한 스무딩 때문이 아니라 구조적 노이즈 때문인가?
  • RQ4MCGL의 구조적 노이즈에 대한 내성은 GCN과 비교해 어떻게 다른가?
  • RQ5MCGL의 깊이 제한에 대한 통찰은 GCN의 깊이 제한 원인을 설명하는 데 기여할 수 있는가?

주요 결과

  • 청소된 그래프에서는 비선형 결정 경계 또는 커뮤니티 구조를 가진 데이터셋에서 MCGL이 GCN을 능가하지만, 고분산 데이터셋에서는 GCN이 더 우수한 성능을 보였다.
  • MCGL은 GCN보다 그래프 구조적 노이즈에 더 민감하여, 네 개의 실세계 노이즈가 있는 데이터셋에서 낮은 내성을 보였다.
  • 깊이 증가에 따른 GCN의 성능 저하는 과도한 스무딩이 아니라 구조적 노이즈로 인한 것이며, 이는 실증적으로 검증되었다.
  • bad edges로 인해 잘못된 허위 샘플의 수가 증가함에 따라 MCGL은 너무 깊어질 수 없으며, 이는 모델 성능 저하를 초래한다.
  • GCN의 깊이 제한은 MCGL을 제한하는 것과 동일한 노이즈 문제와 깊이 연관되어 있어, 공통된 근본 원인이 있음을 시사한다.
  • GCN의 데이터 증강 해석은 스펙트럼 또는 스페이셜 해석보다 더 투명하고 해석 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.