[论文解读] Supervised Learning on Relational Databases with Graph Neural Networks
本文提出了一种基于图神经网络(GNN)的方法,直接在关系型数据库上进行监督学习,无需展平或人工特征工程。通过将表和外键关系建模为异构图,该方法保留了关系结构,并在三个基准数据集中的两个上优于最先进自动特征工程方法,证明了GNN在利用关系数据进行机器学习方面的有效性。
The majority of data scientists and machine learning practitioners use relational data in their work [State of ML and Data Science 2017, Kaggle, Inc.]. But training machine learning models on data stored in relational databases requires significant data extraction and feature engineering efforts. These efforts are not only costly, but they also destroy potentially important relational structure in the data. We introduce a method that uses Graph Neural Networks to overcome these challenges. Our proposed method outperforms state-of-the-art automatic feature engineering methods on two out of three datasets.
研究动机与目标
- 解决在关系型数据库上训练机器学习模型时,传统特征工程带来的高成本和结构损失问题。
- 实现在规范化关系型数据库(RDB)模式上的端到端学习,无需数据展平。
- 评估GNN是否能有效利用RDB中的关系结构,从而在预测性能上超越标准特征工程方法。
- 探究关系复杂度(表的数量和外键数量)对GNN性能的影响。
提出的方法
- 该方法从RDB模式构建异构图,其中表为节点类型,外键关系为表之间的有向边。
- 表中的每一行作为图中的一个节点,其特征由列值派生,外键引用则通过连接跨表节点的边进行建模。
- 使用GNN模型(GCN、GIN、GAT或其实体-关系变体)在图上执行消息传递,以学习上下文相关的节点表示。
- 通过在目标表节点上应用读出层进行最终预测,模型通过经验风险最小化和交叉熵损失进行训练。
- 该方法包含一种堆叠策略,将GNN的预激活输出与表格特征通过GBDT结合,以缓解过拟合并提升性能。
- 在三个真实世界RDB上进行评估:Acquire Valued Shoppers、Home Credit Default Risk和KDD Cup 2014,主要使用AUROC作为评估指标。
实验结果
研究问题
- RQ1GNN是否能在不展平或人工特征工程的情况下有效学习关系型数据库,其性能与最先进特征工程方法相比如何?
- RQ2数据库的关系复杂度(表的数量和外键关系数量)是否与基于GNN模型的性能增益相关?
- RQ3在关系数据上,使用实体-关系消息传递的GNN是否相比标准GNN具有显著优势?
- RQ4将GNN输出与传统表格模型堆叠,是否能进一步提升关系学习任务的性能?
- RQ5尽管在其他两个数据集上表现良好,为何GNN在KDD Cup 2014数据集上表现不佳?这对其数据的关系结构有何启示?
主要发现
- 在Acquire Valued Shoppers Challenge数据集上,最佳GNN变体(ERGCN)的AUROC达到0.040 ± 0.002,显著优于最佳基线方法(DFS + GBDT)的0.027 ± 0.002。
- 在Home Credit Default Risk数据集上,ERGCN模型的AUROC达到0.030 ± 0.002,超过最佳基线方法(DFS + GBDT)的0.029 ± 0.002。
- 在KDD Cup 2014数据集上,没有任何GNN变体优于最佳基线,所有模型的AUROC值均在0.013–0.015之间,表明该数据集中的关系信号有限。
- GNN性能与关系复杂度强相关:表和外键关系更多的数据集(如Acquire和Home Credit)获得了更大的性能增益,而关系性较弱的KDD Cup 2014数据集则未见收益。
- 将GNN预测结果与GBDT堆叠在部分数据集上提升了性能,但未带来一致增益,且在所有数据集上并无单一GNN架构始终优于其他模型。
- 研究表明,当关系结构丰富且信息量大时,GNN最为有效;此外,通过预训练文本嵌入进行迁移学习,可能进一步提升在文本密集型RDB上的性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。