Skip to main content
QUICK REVIEW

[論文レビュー] Supervised Learning on Relational Databases with Graph Neural Networks

Milan Cvitkovic|arXiv (Cornell University)|Feb 6, 2020
Advanced Graph Neural Networks参考文献 25被引用数 12
ひとこと要約

この論文は、正規化されたリレーショナルデータベース(RDB)スキーマをフラット化したり手動で特徴量を設計したりせずに、直接的に関係的データベース上で教師あり学習を実行するためのグラフニューラルネットワーク(GNN)ベースの手法を提案している。テーブルと外部キー関係を異種グラフとしてモデル化することで、関係構造を保持し、3つのベンチマークデータセットのうち2つにおいて最先端の自動特徴量工学手法を上回る性能を示した。これは、GNNが機械学習における関係的データを効果的に活用できることを示している。

ABSTRACT

The majority of data scientists and machine learning practitioners use relational data in their work [State of ML and Data Science 2017, Kaggle, Inc.]. But training machine learning models on data stored in relational databases requires significant data extraction and feature engineering efforts. These efforts are not only costly, but they also destroy potentially important relational structure in the data. We introduce a method that uses Graph Neural Networks to overcome these challenges. Our proposed method outperforms state-of-the-art automatic feature engineering methods on two out of three datasets.

研究の動機と目的

  • リレーショナルデータベース上で機械学習モデルを訓練する際の従来の特徴量工学におけるコストの高さと構造的損失の問題に対処すること。
  • データのフラット化を伴わずに、正規化されたリレーショナルデータベース(RDB)スキーマ上でエンドツーエンドの学習を可能にすること。
  • GNNがRDB内の関係構造を効果的に活用できるかどうかを評価すること。特に、標準的な特徴量工学手法に比べて予測性能が向上するかを検証すること。
  • リレーショナルデータベースの複雑さ(テーブル数や外部キーの数)がGNNの性能に与える影響を調査すること。

提案手法

  • RDBスキーマから異種グラフを構築し、テーブルをノードタイプとし、外部キー関係をそれらの間の有向エッジとする。
  • 各テーブルの行をグラフ内のノードとして表現し、カラム値から得られる特徴量を備える。外部キー参照は、異なるテーブル間のノードを接続するエッジとしてモデル化する。
  • GNNモデル(GCN、GIN、GAT、またはそれらのエンティティ・リレーション型変種)が、グラフ全体にメッセージパッシングを実行し、文脈に応じたノード表現を学習する。
  • 最終的な予測は、ターゲットテーブルのノードに読み出し層を適用することで得られ、交差エントロピー損失を用いた経験的リスク最小化によりモデルを訓練する。
  • 過学習を軽減し、性能を向上させるために、GNNの事前ログティクスとテーブル特徴量をGBDTを用いてスタッキングする戦略を導入している。
  • 実世界の3つのRDB(Acquire Valued Shoppers、Home Credit Default Risk、KDD Cup 2014)を用い、主にAUROCを評価指標として使用して手法を評価した。

実験結果

リサーチクエスチョン

  • RQ1GNNは、フラット化や手動の特徴量工学を経ずにリレーショナルデータベースから学習でき、かつ最先端の特徴量工学手法に比べて性能が優れているか?
  • RQ2データベースのリレーショナル複雑さ(テーブル数や外部キー関係の数)は、GNNベースのモデルの性能向上と相関しているか?
  • RQ3GNNにエンティティ・リレーション型メッセージパッシングを適用することで、標準的なGNNに比べて顕著な利点が得られるか?
  • RQ4GNNの出力を従来のテーブルベースのモデルとスタッキングすることで、リレーショナル学習タスクの性能がさらに向上するか?
  • RQ5KDD Cup 2014データセットではGNNが他の2つと比べて性能を発揮できないが、その理由は何か?これはデータのリレーショナル構造に何を示唆しているか?

主な発見

  • Acquire Valued Shoppers Challengeデータセットでは、最良のGNNバリアント(ERGCN)がAUROC 0.040 ± 0.002を達成し、最良のベースライン(DFS + GBDT)の0.027 ± 0.002を顕著に上回った。
  • Home Credit Default Riskデータセットでは、ERGCNモデルがAUROC 0.030 ± 0.002を達成し、最良のベースライン(DFS + GBDT)の0.029 ± 0.002を上回った。
  • KDD Cup 2014データセットでは、いかなるGNNバリアントも最良のベースラインを上回らなかった。全モデルがAUROC 0.013~0.015程度の値を示し、このデータセットには限られたリレーショナル信号が存在すると示唆された。
  • GNNの性能はリレーショナル複雑さと強く相関していた。テーブル数や外部キー関係の多いデータセット(例:Acquire、Home Credit)では大きな向上が見られたが、リレーショナル構造が乏しいKDD Cup 2014データセットでは恩恵が得られなかった。
  • GNNの出力をGBDTとスタッキングすることで一部のデータセットで性能向上が見られたが、一貫した向上は得られず、全データセットで一貫して優れたGNNアーキテクチャは特定できなかった。
  • 本研究は、GNNがリレーショナル構造が豊富で情報が多く含まれる状況で最も効果的であることを示唆しており、特にテキストを多く含むRDBでは事前学習済みのテキスト埋め込みを用いた転移学習が性能向上に寄与する可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。