Skip to main content
QUICK REVIEW

[논문 리뷰] A Survey of Imbalanced Learning on Graphs: Problems, Techniques, and Future Directions

Zemin Liu, Yuan Li|arXiv (Cornell University)|2023. 08. 26.
Imbalanced Data Classification Techniques인용 수 6
한 줄 요약

이 종합 검토는 그래프에서의 불균형 학습(ILoGs)에 대해 포괄적인 리뷰를 제공하며, 노드, 엣지, 그래프 수준에서의 클래스 및 구조적 불균형을 다루는 두 가지 통합 분류 체계—문제 분류체계(클래스 및 구조적 불균형)와 기법 분류체계(데이터-, 모델-, 손실 기반 방법)를 소개한다. 핵심 과제를 규명하고 기존 해결책을 검토하며, 벤치마킹, 합성 데이터 생성, 기초 모델을 통한 데이터 불균형 하에서의 그래프 학습을 위한 향후 연구 방향을 제시한다.

ABSTRACT

Graphs represent interconnected structures prevalent in a myriad of real-world scenarios. Effective graph analytics, such as graph learning methods, enables users to gain profound insights from graph data, underpinning various tasks including node classification and link prediction. However, these methods often suffer from data imbalance, a common issue in graph data where certain segments possess abundant data while others are scarce, thereby leading to biased learning outcomes. This necessitates the emerging field of imbalanced learning on graphs, which aims to correct these data distribution skews for more accurate and representative learning outcomes. In this survey, we embark on a comprehensive review of the literature on imbalanced learning on graphs. We begin by providing a definitive understanding of the concept and related terminologies, establishing a strong foundational understanding for readers. Following this, we propose two comprehensive taxonomies: (1) the problem taxonomy, which describes the forms of imbalance we consider, the associated tasks, and potential solutions; (2) the technique taxonomy, which details key strategies for addressing these imbalances, and aids readers in their method selection process. Finally, we suggest prospective future directions for both problems and techniques within the sphere of imbalanced learning on graphs, fostering further innovation in this critical area.

연구 동기 및 목표

  • 그래프 기반 머신 러닝에서 고자원 및 저자원 그룹 간 성능이 왜곡되는 데이터 불균형 문제의 증가 추세에 대응하기 위해.
  • 불균형 학습에 대한 분산된 문헌을 체계적인 문제 및 기법 분류 체계를 도입하여 통합하기 위해.
  • 노드 정도를 초월한 구조 기반 불균형을 포함한 엣지 수준 및 그래프 수준의 불균형과 같은 다루지 않은 연구 영역를 규명하기 위해.
  • 불균형 유형과 해결 전략에 따라 기법을 분류하여 연구자들이 적절한 기법을 선택하는 데 도움을 주기 위해.
  • 통합 벤치마크, 확산 모델을 활용한 합성 데이터, 텍스트 기반 그래프 학습을 위한 기초 모델 통합을 포함한 향후 연구 방향을 제안하기 위해.

제안 방법

  • 노드, 엣지, 그래프 수준에서의 클래스 불균형과 구조 불균형(예: 차수, 일반화된 노드 차수, 그래프 크기 변동)을 고려한 문제 분류체계를 제안한다.
  • 데이터 수준(예: 오버샘플링, 언더샘플링), 모델 수준(예: 어텐션 메커니즘, 그래프 증강), 손실 수준(예: 포칼 손실, 클래스 인식 가중치) 전략으로 나누는 기법 분류체계를 도입한다.
  • 이러한 범주에 속하는 기존 기법들을 검토하며, 불균형 데이터 하에서 노드 분류, 링크 예측, 그래프 분류 작업에서 편향을 완화하는 데의 효과성을 분 析한다.
  • 그래프에서의 비i.i.d.성과 구조적 종속성으로 인해 비전 및 NLP 분야에서의 기법을 그대로 그래프 데이터에 적용하는 데 한계가 있음을 분 析한다.
  • 특히 분자의 지식 그래프 응용 분야에서 소수의 링크 예측 및 제로샷 그래프 분류 작업에 적합한 작업별 솔루션이 필요하다고 강조한다.
  • 확산 모델을 활용한 합성 데이터 생성 및 기초 모델(GPT 등)을 통한 텍스트 보강 그래프 학습 기법 등 새로운 기법들을 논의한다.
Figure 1 : This timeline showcases the representative research literature on ILoGs in relation to our taxonomies, i.e. , Problems and Techniques. The total number of research works for each year is also displayed, illustrating an upward trend.
Figure 1 : This timeline showcases the representative research literature on ILoGs in relation to our taxonomies, i.e. , Problems and Techniques. The total number of research works for each year is also displayed, illustrating an upward trend.

실험 결과

연구 질문

  • RQ1그래프 구조 데이터에서의 데이터 불균형은 어떤 특별한 형태를 띠며, 표준형, 비전, NLP 환경에서의 불균형과 어떻게 다를까?
  • RQ2그래프의 고유한 구조적 종속성으로 인해 불균형 학습 기법을 체계적으로 분류하고 그래프 학습에 적응시키는 방법은 무엇인가?
  • RQ3특히 엣지 수준 및 그래프 수준에서의 불균형 학습 문제 중 다루지 않은 핵심 연구 과제는 무엇인가?
  • RQ4확산 모델 및 기초 모델과 같은 신규 기법을 어떻게 활용하여 저자원 그래프 그룹의 성능을 향상시킬 수 있는가?
  • RQ5통합 벤치마크 및 랭킹 시스템은 불균형 그래프 학습 연구의 재현 가능성과 진전을 어떻게 촉진할 수 있는가?

주요 결과

  • 그래프 학습에서의 클래스 불균형은 주로 노드 수준에서 다뤄졌지만, 소수의 링크 예측 및 불균형 그래프 분류 작업을 포함한 엣지 수준 및 그래프 수준 작업은 여전히 다루지 않은 상태이다.
  • 노드 차수나 일반화된 구조적 맥락의 변동 등 구조적 불균형은 모델 성능에 상당한 영향을 미치며, 현재의 방법들에서는 자주 간과된다.
  • 현재 기법들은 주로 노드 수준 작업에 국한되어 있으며, 그래프 크기 변동이나 구조적 이질성의 원인이 되는 불균형을 다루는 방법은 거의 없다.
  • 예를 들어 데이터 수준 기법을 모델 수준 문제에 적용하는 등 교차 분야의 기법 탐색은 잠재력이 있으며, 현재 문헌에서는 활용이 부족한 편이다.
  • 확산 모델을 활용한 합성 데이터 생성은 GAN에 비해 저자원 그룹의 균형을 맞추는 데 유의미한 대안이 되며, 특히 분자 및 지식 그래프 응용 분야에서 유용하다.
  • 통합된 벤치마크와 랭킹 시스템의 부재는 연구 진전을 저해하며, 공정한 비교와 재현 가능성을 보장하기 위한 표준화된 평가 프레임워크의 필요성을 암시한다.
Figure 2 : Imbalanced learning on graphs: imbalanced graph resource distribution results in imbalanced outcomes.
Figure 2 : Imbalanced learning on graphs: imbalanced graph resource distribution results in imbalanced outcomes.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.