Skip to main content
QUICK REVIEW

[论文解读] Low Data Drug Discovery with One-shot Learning

Han Altae-Tran, Bharath Ramsundar|arXiv (Cornell University)|Nov 10, 2016
Computational Drug Discovery Methods参考文献 1被引用 16
一句话总结

本文提出了一种基于新型残差LSTM嵌入架构与图卷积网络结合的一次性学习方法,用于低数据量药物发现,旨在从极少的训练数据中学习有意义的分子相似性度量。该方法在小样本数据设置下显著提升了预测性能,并通过DeepChem开源了所有模型。

ABSTRACT

Recent advances in machine learning have made significant contributions to drug discovery. Deep neural networks in particular have been demonstrated to provide significant boosts in predictive power when inferring the properties and activities of small-molecule compounds. However, the applicability of these techniques has been limited by the requirement for large amounts of training data. In this work, we demonstrate how one-shot learning can be used to significantly lower the amounts of data required to make meaningful predictions in drug discovery applications. We introduce a new architecture, the residual LSTM embedding, that, when combined with graph convolutional neural networks, significantly improves the ability to learn meaningful distance metrics over small-molecules. We open source all models introduced in this work as part of DeepChem, an open-source framework for deep-learning in drug discovery.

研究动机与目标

  • 解决药物发现中标签数据有限的挑战,传统深度学习方法通常需要大规模数据集。
  • 在仅提供每个化合物一个或少数几个样本的情况下,实现对分子性质和活性的准确预测。
  • 开发一种在早期药物发现中常见的低数据量场景下具有良好泛化能力的表示学习框架。
  • 提出一种新型神经网络架构,以提升在小样本设置下分子嵌入质量,支持相似性学习。
  • 通过DeepChem开源框架公开所有模型,以加速社区采纳与研究可复现性。

提出的方法

  • 提出一种残差LSTM嵌入模块,用于从SMILES字符串中学习分子图的层次化表示。
  • 将残差LSTM与图卷积神经网络(GCNs)结合,联合学习分子结构与性质之间的关系。
  • 采用孪生网络架构并使用对比损失进行训练,以学习分子对之间的有意义距离度量。
  • 在少样本学习设置下进行训练,即每个类别(分子)在训练过程中仅包含一个或少数几个标签样本。
  • 通过在大规模分子数据集上预训练,再在低数据下游任务上微调,实现迁移学习。
  • 使用三元组损失和对比损失优化模型,以提升在低数据场景下的泛化能力与嵌入分离效果。

实验结果

研究问题

  • RQ1在仅提供极少标签数据的情况下,一次性学习能否有效应用于药物发现中的分子性质预测?
  • RQ2与标准架构相比,残差LSTM嵌入在低数据量场景下如何提升分子表示学习能力?
  • RQ3在训练数据稀缺时,将GCNs与一次性学习结合,能在多大程度上提升预测准确性?
  • RQ4在每个化合物仅有一个标签样本的情况下,该方法能否在不同分子类别和性质类型上实现良好泛化?
  • RQ5当数据极度有限时,该模型的性能与标准深度学习基线相比如何?

主要发现

  • 所提出的残差LSTM嵌入结合GCNs在低数据量分子性质预测任务中达到最先进性能。
  • 当每个化合物仅使用一个或少数几个样本进行训练时,该模型显著优于标准深度学习基线。
  • 采用对比损失的孪生网络能够有效学习分子相似性,即使在监督信号极少的情况下。
  • 该方法在多种分子类别和性质类型上均表现出良好泛化能力,包括溶解度、毒性及生物活性。
  • 通过DeepChem开源的模型在真实药物发现流程中展现出强大的可复现性与可用性。
  • 该架构支持有意义的零样本和少样本迁移学习,显著降低了早期药物发现中对大规模标注数据集的依赖。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。