[論文レビュー] OGB-LSC: A Large-Scale Challenge for Machine Learning on Graphs
OGB-LSC はノード・リンク・グラフレベルの予測のために 3つの現実世界の超大規模グラフデータセット(MAG240M、WikiKG90M、PCQM4M)を導入し、スケーラブルなベースラインと KDD Cup 2021 の結果が表すように、表現力豊かな GNN が scale で単純なベースラインを上回る。
Enabling effective and efficient machine learning (ML) over large-scale graph data (e.g., graphs with billions of edges) can have a great impact on both industrial and scientific applications. However, existing efforts to advance large-scale graph ML have been largely limited by the lack of a suitable public benchmark. Here we present OGB Large-Scale Challenge (OGB-LSC), a collection of three real-world datasets for facilitating the advancements in large-scale graph ML. The OGB-LSC datasets are orders of magnitude larger than existing ones, covering three core graph learning tasks -- link prediction, graph regression, and node classification. Furthermore, we provide dedicated baseline experiments, scaling up expressive graph ML models to the massive datasets. We show that expressive models significantly outperform simple scalable baselines, indicating an opportunity for dedicated efforts to further improve graph ML at scale. Moreover, OGB-LSC datasets were deployed at ACM KDD Cup 2021 and attracted more than 500 team registrations globally, during which significant performance improvements were made by a variety of innovative techniques. We summarize the common techniques used by the winning solutions and highlight the current best practices in large-scale graph ML. Finally, we describe how we have updated the datasets after the KDD Cup to further facilitate research advances. The OGB-LSC datasets, baseline code, and all the information about the KDD Cup are available at https://ogb.stanford.edu/docs/lsc/ .
研究の動機と目的
- 大規模で現実的なグラフ ML のベンチマークをノード・リンク・グラフレベルのタスク全体で提供する。
- 単純でスケーラブルなベースラインと表現力豊かな GNN のスケール時の性能ギャップを評価する。
- 大規模グラフ学習のベンチマーク、ベースライン、リーダーボードを通じたコミュニティの関与を促進する。
- 重要な KDD Cup 2021 コンペティションからの実用的洞察を分析する。
- 大規模グラフ ML の進展を維持するためのデータセットの更新を提供する。
提案手法
- 3 つのデータセット(MAG240M、WikiKG90M、PCQM4M)をノード/エッジ/グラフ統計とともに導入する。
- エンティティ/論文に対する RoBERTa ベースのテキスト特徴と標準的なグラフ特徴を提供する。
- 隣接サンプリングを用いた単純なベースライン(MLP、Label Propagation)からスケーラブルな表現力豊かな GNN(GraphSAGE、GAT)までのモデルをベンチマークする。
- MAG240M において関係特有の重みを持つ異種グラフへ拡張する(R-GraphSAGE、R-GAT)。
- 評価指標としてノード分類の正解率、 KG 完成の MRR、グラフ回帰の MAE を用いる。
- KDD Cup 2021 の結果を報告し、勝者が用いた共通技術を要約する。
実験結果
リサーチクエスチョン
- RQ1大規模グラフは表現力豊かな GNN と単純なベースラインの性能にどのような影響を与えるか。
- RQ2MAG240M における異種性と関係特有のモデリングはノードレベル予測にどのような影響を及ぼすか。
- RQ3WikiKG90M における知識グラフ完成はテキストと構造エンコーダの組み合わせから恩恵を受けるか。
- RQ4大規模・深い GNN を用いたグラフレベルの分子特性予測において、どの程度の性能向上が得られ、化学的ベンチマークに近づくか。
- RQ5KDD Cup 2021 の受賞者はベースラインよりも大幅な改善を達成しており、モデルアンサンブル、時系列情報、先進的アーキテクチャ(例:Transformer ベースの UniMP、KG エンコーダ) の価値を示しているか。
主な発見
- 隣接サンプリングを用いた表現力豊かな GNN は MAG240M および WikiKG90M において単純なベースラインを大幅に上回り、正解率や MRR が数ポイント程度向上する。
- MAG240M で異種関係を利用すると同種設定より顕著な改善が見られる。
- テキスト情報と構造埋め込みを組み合わせた(結合エンコーダ)アプローチは KG 完成タスクの WikiKG90M で高い性能を示す。
- 深く大規模な GNN とグローバルメッセージ伝搬、場合によっては 3D 分子構造情報を活用することで PCQM4M/PCQM4Mv2 の結果が大幅に改善され、化学関連のベンチマークに近づく。
- KDD Cup 2021 の優勝者はベースラインより大幅な改善を達成しており、モデルアンサンブル、時系列情報、先進的アーキテクチャの価値を強調している(例:Transformer ベースの UniMP、KG エンコーダ)。
- WikiKG90Mv2 は難易度の高いネガティブ選択設定を導入しており、現実的な KG 完成課題を反映し、楽観的なスコアを抑制する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。