[論文レビュー] GOOD: A Graph Out-of-Distribution Benchmark
GOODは、11のデータセット(グラフタスクとノードタスク)全体で協變量シフトと概念シフトを含む系統的なグラフOODベンチマークを開発し、51のドメイン分割と10のベースラインの評価を可能にし、ID–OODのギャップが顕著であることを明らかにする。
Out-of-distribution (OOD) learning deals with scenarios in which training and test data follow different distributions. Although general OOD problems have been intensively studied in machine learning, graph OOD is only an emerging area of research. Currently, there lacks a systematic benchmark tailored to graph OOD method evaluation. In this work, we aim at developing an OOD benchmark, known as GOOD, for graphs specifically. We explicitly make distinctions between covariate and concept shifts and design data splits that accurately reflect different shifts. We consider both graph and node prediction tasks as there are key differences in designing shifts. Overall, GOOD contains 11 datasets with 17 domain selections. When combined with covariate, concept, and no shifts, we obtain 51 different splits. We provide performance results on 10 commonly used baseline methods with 10 random runs. This results in 510 dataset-model combinations in total. Our results show significant performance gaps between in-distribution and OOD settings. Our results also shed light on different performance trends between covariate and concept shifts by different methods. Our GOOD benchmark is a growing project and expects to expand in both quantity and variety of resources as the area develops. The GOOD benchmark can be accessed via https://github.com/divelab/GOOD/.
研究の動機と目的
- covariateと概念シフトを区別する、グラフ特化のOODベンチマークの必要性を動機づける。
- covariateと概念シフトの両方を反映する、グラフデータの系統的でドメイン制御された分割戦略を設計する。
- グラフレベル、ノードレベル、グラフ回帰タスクの多様なスイートを提供し、グラフOOD評価を拡張する。
提案手法
- 入力特徴量(X_ind)に基づくドメインを分割して共変量シフトを定義し、Yに依存しないP_train(X) != P_test(X)を作成する一方、P(Y|X)は一定に保つ。
- 偽のドメイン–出力相関(P(Y|X_ind))を概念ごとに変化させ、概念シフトを定義する一方、X_invがYを完全に決定することを保証する。
- 不変学習フレームワーク(ICP/IRM)をサポートし、制御されたOOD評価を可能にする環境(ドメインと概念)を設計する。
- 11データセット(グラフレベル6、ノードレベル5)を組み立て、51のドメイン分割(共変量、概念、シフトなし)を作成し、10のベースライン手法を10回の乱数実行で評価する。
- グラフ+ノード予測タスクの強調とグラフ回帰データセットの包含に焦点を当て、データセット処理の詳細とスクリプトを提供する。
実験結果
リサーチクエスチョン
- RQ1共変量シフトと概念シフトは、さまざまなデータセットやタスクにおいてグラフベース学習へどのように異なる影響を与えるのか?
- RQ2同じドメイン選択内で、1つのベンチマークは共変量シフトと概念シフトの効果を体系的に比較できるのか?
- RQ3グラフとノード予測タスクにおけるID設定とOOD設定の間で、ベースラインの性能ギャップはどの程度か?
- RQ4共変量シフトと概念シフトの下で、グラフレベルとノードレベルの両タスクにおいて、グラフ特化のOOD手法は一貫して有利であるのか?
主な発見
- 51の分割と11のデータセットにわたって、IDとOOD設定の間に顕著な性能ギャップが存在する。
- 多くのケースで、OOD検証セットがより良い一般化を持つモデルを選択する上でID検証より優れている。
- グラフ特化のOOD手法は、共変量シフトと概念シフトの間で有効性が異なり、シフトタイプ依存の傾向を強調する。
- GOODはグラフ分類、回帰、ノード分類を含む広く多様なベンチマークを提供し、将来の手法開発を支える。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。