[논문 리뷰] New Benchmarks for Learning on Non-Homophilous Graphs
본 논문은 더 크고 다양한 비동질성 그래프 데이터 셋과 새로운 동질성 측정치를 도입한 뒤, 간단한 베이스라인과 비동질성 GNN을 벤치마크하여 비동질성 설정에 대한 통찰을 제시한다.
Much data with graph structures satisfy the principle of homophily, meaning that connected nodes tend to be similar with respect to a specific attribute. As such, ubiquitous datasets for graph machine learning tasks have generally been highly homophilous, rewarding methods that leverage homophily as an inductive bias. Recent work has pointed out this particular focus, as new non-homophilous datasets have been introduced and graph representation learning models better suited for low-homophily settings have been developed. However, these datasets are small and poorly suited to truly testing the effectiveness of new methods in non-homophilous settings. We present a series of improved graph datasets with node label relationships that do not satisfy the homophily principle. Along with this, we introduce a new measure of the presence or absence of homophily that is better suited than existing measures in different regimes. We benchmark a range of simple methods and graph neural networks across our proposed datasets, drawing new insights for further research. Data and codes can be found at https://github.com/CUAI/Non-Homophily-Benchmarks.
연구 동기 및 목표
- 더 작은 합성 데이터 세트뿐 아니라 더 나은 비동질성 그래프 벤치마크의 필요성에 대해 동기를 부여한다.
- 다양한 맥락 및 라벨-토폴로지 관계를 가진 더 크고 실제 세계의 비동질성 데이터 세트를 제안한다.
- 클래스 불균형 및 크기 효과를 완화하는 강인한 동질성 측정치를 소개한다.
- 제안된 데이터 세트에서 강력한 간단한 방법을 재도입하고 다양한 GNN 및 베이스라인을 평가한다.
- 저동질성 영역에서 방법의 성능과 확장성에 대한 통찰을 제공한다.
제안 방법
- 새로운 동질성 측정치 hat{h}를 제시하여 클래스별 이웃 유사성을 집계하되 클래스 크기를 제어한다.
- 가능한 경우 노드 특징이 있는 도메인(예: 사회 네트워크, 생물학, 시간 기반/인용 데이터)에서 여러 대형 실제 비동질성 데이터 세트를 수집한다.
- MBP, 라벨 전파(1-홉 및 2-홉), LINK, SGC, C&S, 일반 GNN(GCN, GAT, APPNP, JK 변형), 및 비동질성 GNN(H2GCN, MixHop, GPR-GNN)을 포함한 광범위한 방법을 벤치마크한다.
- 고정된 다섯 개의 학습/검증/테스트 분할에서 표준 정확도 또는 ROC-AUC로 평가한다(ogbn-proteins는 Open Graph Benchmark 분할을 사용한다).
- 비동질성 방법을 대규모 데이터 세트에 적용할 때의 메모리 제약 및 확장성에 대해 논의한다.
실험 결과
연구 질문
- RQ1기존의 비동질성 학습 방법들이 더 크고 실제 세계의 비동질성 그래프에서 어떻게 성능하는가?
- RQ2노드 특징 및 위상 기반 베이스라인의 간단한 혼합이 다양한 데이터 세트에서 특수한 비동질성 GNN에 비해 경쟁력이 있거나 우수한가?
- RQ3새로 제안된 동질성 측정치 hat{h}는 전통적인 에지 동질성과 데이터 세트 간 모델 성능과 어떤 관계가 있는가?
- RQ4비동질성 그래프 학습 방법의 확장성과 성능 간의 트레이드오프는 무엇인가?
- RQ5간단한 두 홉 변형이 데이터 세트 전체에서 비동질성 설정에서 성능을 개선할 수 있는가?
주요 결과
- 제안된 데이터 세트 전반에 걸쳐 노드 특징이나 그래프 토폴로지를 사용하는 간단한 베이스라인이 무작위보다 더 잘 수행한다.
- 비동질성 GNN은 보통 잘 작동하지만 항상은 아니며, 2-홉 변형이 종종 이득을 제공한다.
- 전통적인 저랭크/저패스 가정(일부 동질성 주도 모델에서 보임)은 비동질성 설정에서 성능을 저하시켜 일부 간단한 GNN의 효과를 감소시킨다.
- NODE 특징을 사용하지 않는 토폴로지 기반 베이스라인인 LINK가 여러 데이터 세트에서 좋은 성능을 보인다.
- 메모리 고려 사항: 더 큰 비동질성 벤치마크는 일부 방법의 메모리 및 확장성 문제를 드러내며 확장성과 성능 간의 균형을 강조한다.
- 새로운 hat{h} 측정치는 클래스 불균형 효과를 완화하고 다양한 데이터 세트에서 동질성의 존재를 더 잘 포착한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.