[논문 리뷰] GOOD: A Graph Out-of-Distribution Benchmark
GOOD은 11개의 데이터셋(graph 및 node 과제)에 걸친 공변량 및 개념 변화로 구성된 체계적인 그래프 OOD 벤치마크를 개발하여 51개의 도메인 분할 및 10개의 베이스라인 평가를 가능하게 하며, ID–OOD 간의 유의미한 격차를 드러낸다.
Out-of-distribution (OOD) learning deals with scenarios in which training and test data follow different distributions. Although general OOD problems have been intensively studied in machine learning, graph OOD is only an emerging area of research. Currently, there lacks a systematic benchmark tailored to graph OOD method evaluation. In this work, we aim at developing an OOD benchmark, known as GOOD, for graphs specifically. We explicitly make distinctions between covariate and concept shifts and design data splits that accurately reflect different shifts. We consider both graph and node prediction tasks as there are key differences in designing shifts. Overall, GOOD contains 11 datasets with 17 domain selections. When combined with covariate, concept, and no shifts, we obtain 51 different splits. We provide performance results on 10 commonly used baseline methods with 10 random runs. This results in 510 dataset-model combinations in total. Our results show significant performance gaps between in-distribution and OOD settings. Our results also shed light on different performance trends between covariate and concept shifts by different methods. Our GOOD benchmark is a growing project and expects to expand in both quantity and variety of resources as the area develops. The GOOD benchmark can be accessed via https://github.com/divelab/GOOD/.
연구 동기 및 목표
- 공변량과 개념 변화를 구분하는 그래프 전용 OOD 벤치마크의 필요성을 제시한다.
- 공변량과 개념 변화를 모두 반영하는 체계적이고 도메인 제어된 그래프 데이터 분할 전략을 설계한다.
- 그래프 수준, 노드 수준, 그래프 회귀 과제를 다양하게 제공하여 그래프 OOD 평가를 확장한다.
제안 방법
- X_ind를 이용해 Y와 독립적으로 도메인을 분할하여 P_train(X) != P_test(X)를 만들고 P(Y|X)는 일정하게 유지하여 공변량 변 shifts를 정의한다.
- X_ind를 통해 도메인–출력의 허위 상관(P(Y|X_ind))을 개념 간 바뀌도록 도입하되 X_inv가 Y를 완전히 결정하도록 보장하여 개념 변 shifts를 정의한다.
- 불변 학습 프레임워크(ICP/IRM)를 지원하고 제어된 OOD 평가를 가능하게 하는 환경(도메인 및 개념) 설계한다.
- 11개 데이터셋(6 그래프 수준, 5 노드 수준)과 51 도메인 분할(공변량, 개념, 무변이 있음) 및 10개의 임의 실행에서 10개 베이스라인 방법을 평가한다.
- 그래프 + 노드 예측 과제에 초점을 두고 그래프 회귀 데이터셋 포함을 강조한 데이터셋 처리 세부사항 및 스크립트를 제공한다.
실험 결과
연구 질문
- RQ1공변량과 개념 변화가 다양한 데이터셋과 과제에서 그래프 기반 학습에 어떻게 다르게 영향을 미치는가?
- RQ2같은 도메인 선택 내에서 하나의 벤치마크가 공변량 및 개념 변화 효과를 체계적으로 비교할 수 있는가?
- RQ3그래프 및 노드 예측 과제에서 ID와 OOD 설정 간의 베이스라인 성능 격차는 무엇인가?
- RQ4공변량 및 개념 변화 하에서 그래프-전용 OOD 방법이 그래프 수준과 노드 수준 과제 모두에서 일관된 이점을 보이는가?
주요 결과
- 51개 분할과 11개 데이터셋에 걸쳐 ID-OD 설정 간에 상당한 성능 격차가 존재한다.
- 많은 경우 OOD 검증 세트가 일반화가 더 좋은 모델 선택에서 ID 검증을 능가한다.
- 그래프 전용 OOD 방법은 공변량 대 개념 변화에 따라 효과가 다르게 나타나며, 변화 유형에 따른 경향을 강조한다.
- GOOD은 그래프 분류, 회귀, 노드 분류를 포함하는 광범위하고 다양한 벤치마크를 제공하여 미래 방법 개발을 견고하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.