Skip to main content
QUICK REVIEW

[논문 리뷰] GraphSHA: Synthesizing Harder Samples for Class-Imbalanced Node Classification

Wen-Zhi Li, Chang‐Dong Wang|arXiv (Cornell University)|2023. 06. 16.
Advanced Graph Neural Networks인용 수 4
한 줄 요약

GraphSHA는 그래프 구조 데이터에서 '약자 클래스' 문제를 완화하기 위해 더 어려운 소수 클래스 샘플을 합성하는 새로운 데이터 증강 프레임워크를 제안한다. 반면, 이는 이웃 클래스의 성능을 떨어뜨리지 않으면서도 소수 클래스의 결정 경계를 확장한다. 반복적으로 소수 클래스의 경계 근처에 있는 앵커 노드와 이웃 클래스의 보조 노드를 활용해 준 supervision mixup 전략(SemiMixup)을 적용함으로써, 여러 GNN 백본을 사용한 7개의 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Class imbalance is the phenomenon that some classes have much fewer instances than others, which is ubiquitous in real-world graph-structured scenarios. Recent studies find that off-the-shelf Graph Neural Networks (GNNs) would under-represent minor class samples. We investigate this phenomenon and discover that the subspaces of minor classes being squeezed by those of the major ones in the latent space is the main cause of this failure. We are naturally inspired to enlarge the decision boundaries of minor classes and propose a general framework GraphSHA by Synthesizing HArder minor samples. Furthermore, to avoid the enlarged minor boundary violating the subspaces of neighbor classes, we also propose a module called SemiMixup to transmit enlarged boundary information to the interior of the minor classes while blocking information propagation from minor classes to neighbor classes. Empirically, GraphSHA shows its effectiveness in enlarging the decision boundaries of minor classes, as it outperforms various baseline methods in class-imbalanced node classification with different GNN backbone encoders over seven public benchmark datasets. Code is avilable at https://github.com/wenzhilics/GraphSHA.

연구 동기 및 목표

  • 소수 클래스의 잠재 공간에서 압축되는 '약자 클래스 압축' 문제를 해결하기 위해.
  • 결정 경계를 확장함으로써 소수 클래스의 GNN 성능을 향상시키기 위해 더 어려운 학습 샘플을 합성하기 위해.
  • 소수 클래스에서 이웃 클래스로의 정보 흐름을 차단하여 합성 과정에서 이웃 클래스의 간섭을 방지하기 위해.
  • 손실 함수를 수정하지 않고도 소수 클래스 표현을 향상시키는 일반화 가능한, GNN에 종속되지 않는 프레임워크를 개발하기 위해.

제안 방법

  • GraphSHA는 결정 경계 근처에 위치한 어려운 소수 클래스 샘플을 앵커 노드로 식별하여 합성에 활용한다.
  • 합성 샘플을 생성하기 위해 볼록 조합을 사용하는 SemiMixup 모듈을 도입한다: $\mathbf{X}_{\text{syn}} = \delta \mathbf{X}_{\text{anc}} + (1 - \delta) \mathbf{X}_{\text{aux}}$, 여기서 $\mathbf{X}_{\text{anc}}$는 어려운 소수 클래스 샘플이고 $\mathbf{X}_{\text{aux}}$는 이웃 클래스의 노드이다.
  • 혼합 계수 $\delta$는 더 작은 값에 치우친 분포에서 샘플링되어 더 어려운 샘플을 우선시한다.
  • 합성된 특징이 소수 클래스 하위공간 내에 유지되면서도 이웃 클래스 영역으로의 과도한 침범을 방지한다.
  • 앵커 노드의 이웃 클래스에서 보조 노드를 선택하기 위해 위상 구조를 고려한 샘플링 전략을 사용한다.
  • 모든 GNN 백본과 호환되며, 원래 그래프 구조를 변경하지 않고도 잠재 공간에서 작동한다.

실험 결과

연구 질문

  • RQ1소수 클래스의 잠재 공간에서 더 어려운 소수 클래스 샘플을 합성함으로써 결정 경계를 효과적으로 확장할 수 있는가?
  • RQ2합성 과정에서 이웃 클래스의 하위공간으로 침범하거나 성능 저하가 발생하는 것을 방지할 수 있는가?
  • RQ3SemiMixup 모듈에서 혼합 계수 $\delta$의 최적 분포는 무엇인가? 경계 확장과 일반화 사이의 균형을 어떻게 달성할 수 있는가?
  • RQ4GraphSHA는 수동 및 자연적인 불균형 그래프 벤치마크에서 기존의 데이터 증강 및 손실 함수 수정 기반 기준선을 초월하는가?
  • RQ5GraphSHA는 오분류 분포 측정을 통해 '약자 클래스 압축' 문제를 어느 정도 완화하는가?

주요 결과

  • GraphSHA는 소수 클래스의 오분류 비율을 크게 감소시켰으며, 오분류된 샘플이 소수 클래스에 속할 확률이 0.5에 수렴함으로써 결정 경계 확장의 효과를 입증한다.
  • GCN를 사용한 Cora-LT와 CiteSeer-LT에서 GraphSHA는 모든 기준선 대비 최고의 F1 점수를 기록했으며, TAM 및 ReNode와 같은 고급 기법들조차도 이를 능가했다.
  • SemiMixup 모듈은 이웃 클래스의 성능 저하를 방지함을 입증했으며, 결정 경계를 극도로 확장함에도 불구하고 주요 클래스의 성능이 안정된 것으로 나타났다.
  • 하이퍼파rameter 분석 결과, $\mathbb{E}(\delta)$가 작을수록 성능 향상이 뚜렷하여 더 어려운 샘플이 결정 경계 확장에 더 효과적임을 확인했다.
  • t-SNE를 통한 시각화 결과, GraphSHA는 소수 클래스 하위공간을 성공적으로 확장했으며, 테스트 세트의 소수 클래스 노드 중 더 많은 수가 그 잠재 공간 내에 포함됨을 확인했다.
  • GraphSHA는 GCN, GAT, GraphSAGE 등 세 가지 GNN 백본과 일곱 개의 공개 데이터셋에서 일반화 가능하며, 강건성과 확장성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.