[论文解读] First Place Solution of KDD Cup 2021 & OGB Large-Scale Challenge Graph Prediction Track.
本论文展示了KDD Cup 2021 OGB-LSC图预测赛道的获胜解决方案,在测试集上实现了0.1200的MAE。该方法结合了Graphormer与ExpC⋆模型,并通过引入领域特定的分子特征(包括RDKit计算的3D欧几里得距离和RBF嵌入的键长)进行增强,采用8折交叉验证训练,并通过简单平均进行模型集成,以提升泛化能力和性能。
In this technical report, we present our solution of KDD Cup 2021 OGB Large-Scale Challenge - PCQM4M-LSC Track. We adopt Graphormer and ExpC as our basic models. We train each model by 8-fold cross-validation, and additionally train two Graphormer models on the union of training and validation sets with different random seeds. For final submission, we use a naive ensemble for these 18 models by taking average of their outputs. Using our method, our team MachineLearning achieved 0.1200 MAE on test set, which won the first place in KDD Cup graph prediction track.
研究动机与目标
- 开发一种高精度的图神经网络模型,基于2D分子图预测分子的HOMO-LUMO能隙。
- 通过引入从RDKit获得的3D分子结构特征,提升大规模图回归任务中的泛化能力并减少过拟合。
- 在PCQM4M-LSC数据集上实现最先进性能,该数据集是大规模量子化学图基准。
- 展示模型集成与特征工程在分子性质预测图表示学习中的有效性。
提出的方法
- 采用12层、768隐藏维度和32注意力头的Graphormer,使用欧几里得距离作为空间编码特征。
- 应用包含256个基函数的高斯RBF核,将原始欧几里得距离转换为更具泛化能力的表示。
- 通过在键长中添加拉普拉斯噪声增强边特征,基于QM9数据集校准以减少过拟合。
- 使用修改后的ExpC⋆模型,扩大隐藏维度(d′ = 1200),并在聚合前引入非线性激活,以提升表征能力。
- 在训练集与验证集的并集上采用8折交叉验证进行训练,并使用不同随机种子在完整训练+验证数据上进行额外训练。
- 通过简单平均18个模型(16个Graphormer和2个ExpC⋆变体)的预测结果进行集成,以提升鲁棒性与最终性能。
实验结果
研究问题
- RQ1如何通过引入3D分子结构特征来增强图神经网络,以提升在量子化学性质预测任务中的预测精度?
- RQ2RBF嵌入的空间特征在图回归任务中对模型泛化能力有何影响?
- RQ3在大规模分子图预测任务中,通过多样化训练运行和架构的模型集成是否能超越单个模型的性能?
- RQ4不同的超参数设置(如嵌入dropout)如何影响对节点表示敏感度高的小分子图上的性能表现?
- RQ5尽管RDKit生成的3D坐标精度低于DFT优化结构,其在多大程度上能提升模型性能?
主要发现
- 最终模型集成在测试集上实现了0.1200的MAE,获得KDD Cup 2021 OGB-LSC图预测赛道第一名。
- 经过RBF嵌入的欧几里得距离与拉普拉斯增强键特征微调的Graphormer模型展现出更好的泛化能力与更低的验证MAE。
- 尽管精度低于DFT结构,RDKit生成的3D分子结构特征仍提供了有意义的归纳偏置,从而提升了模型性能。
- 将嵌入dropout设为0.0(而非默认的0.1)显著提升了性能,可能是因为分子图规模较小(中位数约15个原子)。
- 对18个模型(包括多个使用不同种子和数据划分训练的Graphormer与ExpC⋆变体)进行的朴素集成,实现了最佳泛化能力与最终得分。
- 在不同PyTorch Geometric版本下,模型输出的微小差异(MAE ≤ 1e-4)凸显了大规模机器学习实验中可复现性的重要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。