Skip to main content
QUICK REVIEW

[论文解读] Meta-Learning GNN Initializations for Low-Resource Molecular Property Prediction

Cuong Q. Nguyen, Constantine Kreatsoulas|arXiv (Cornell University)|Mar 12, 2020
Machine Learning in Materials Science参考文献 28被引用 20
一句话总结

本论文提出通过MAML及其变体(FO-MAML、ANIL)进行元学习图神经网络(GNN)初始化,以提升在低资源设置下的少样本分子性质预测性能。在ChEMBL20数据集上进行训练,元初始化方法在所有微调数据集规模(16至256个样本)下,于分布内和分布外任务中分别实现了平均11.2%和26.9%的AUPRC性能提升,优于多任务预训练基线方法。

ABSTRACT

Building in silico models to predict chemical properties and activities is a crucial step in drug discovery. However, limited labeled data often hinders the application of deep learning in this setting. Meanwhile advances in meta-learning have enabled state-of-the-art performances in few-shot learning benchmarks, naturally prompting the question: Can meta-learning improve deep learning performance in low-resource drug discovery projects? In this work, we assess the transferability of graph neural networks initializations learned by the Model-Agnostic Meta-Learning (MAML) algorithm - and its variants FO-MAML and ANIL - for chemical properties and activities tasks. Using the ChEMBL20 dataset to emulate low-resource settings, our benchmark shows that meta-initializations perform comparably to or outperform multi-task pre-training baselines on 16 out of 20 in-distribution tasks and on all out-of-distribution tasks, providing an average improvement in AUPRC of 11.2% and 26.9% respectively. Finally, we observe that meta-initializations consistently result in the best performing models across fine-tuning sets with $k \in \{16, 32, 64, 128, 256\}$ instances.

研究动机与目标

  • 解决药物发现中标签数据有限的问题,因为深度学习模型常因数据稀疏和偏差而表现不佳。
  • 探究元学习GNN初始化是否相比传统多任务预训练能提升少样本分子性质预测性能。
  • 评估元初始化在不同微调数据量(16至256个样本)下的鲁棒性与可迁移性。
  • 在分布内与分布外分子性质预测任务上评估性能,以检验泛化能力。

提出的方法

  • 采用模型无关元学习(MAML)学习一组初始GNN参数,使其能快速适应新的分子性质预测任务。
  • 使用一阶MAML(FO-MAML)和ANIL(几乎无内层循环)变体,在保持性能的同时降低计算成本。
  • 在来自ChEMBL20的20个多样化分子性质任务上进行元训练,使用任务特定的支持集和查询集完成内层与外层循环优化。
  • 使用固定1e-4的初始学习率和早停策略,对$ k \in \{16, 32, 64, 128, 256\} $个样本每任务的元初始化进行微调,优化器为Adam。
  • 通过在保留测试集上的AUPRC评估性能,结果基于5个随机种子和5组数据划分,共25次运行取平均。

实验结果

研究问题

  • RQ1与多任务预训练基线相比,元学习GNN初始化是否能提升低资源分子性质预测性能?
  • RQ2当在极小数据集上微调时,即$k \in \{16, 32, 64, 128, 256\}$个样本时,元初始化的有效性如何?
  • RQ3元初始化是否能泛化到发生数据分布偏移的分布外分子性质预测任务?
  • RQ4不同元学习变体(MAML、FO-MAML、ANIL)在性能与训练效率方面如何比较?

主要发现

  • 通过MAML学习的元初始化在20个分布内分子性质预测任务中的16个上优于多任务预训练基线。
  • 在所有3个分布外任务中,元初始化始终优于所有基线方法,展现出强大的泛化能力。
  • MAML在分布内任务上相较最佳基线平均提升11.2%的AUPRC,在分布外任务上提升26.9%。
  • MAML在所有微调数据集规模下均保持最优性能,从16到256个样本,对分布内和分布外任务均排名第一。
  • FO-MAML与ANIL在训练时间显著减少的情况下表现出具有竞争力的性能,但平均性能仍低于MAML。
  • Finetune-All与Finetune-Top等基线方法随数据量增加而提升,但在所有$k$值下仍逊于MAML,表明MAML具有更优的数据效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。