[论文解读] A Systematic Survey of Chemical Pre-trained Models
本文首次系统性地综述了化学预训练模型(CPMs),全面回顾了分子描述符、编码器架构(如图神经网络(GNNs)、Transformer)、预训练策略及下游应用。研究识别出模型泛化能力、基准测试可靠性与理论基础方面的关键挑战,并为推进药物发现等领域的分子表征学习提供了关键路线图。
Deep learning has achieved remarkable success in learning representations for molecules, which is crucial for various biochemical applications, ranging from property prediction to drug design. However, training Deep Neural Networks (DNNs) from scratch often requires abundant labeled molecules, which are expensive to acquire in the real world. To alleviate this issue, tremendous efforts have been devoted to Molecular Pre-trained Models (CPMs), where DNNs are pre-trained using large-scale unlabeled molecular databases and then fine-tuned over specific downstream tasks. Despite the prosperity, there lacks a systematic review of this fast-growing field. In this paper, we present the first survey that summarizes the current progress of CPMs. We first highlight the limitations of training molecular representation models from scratch to motivate CPM studies. Next, we systematically review recent advances on this topic from several key perspectives, including molecular descriptors, encoder architectures, pre-training strategies, and applications. We also highlight the challenges and promising avenues for future research, providing a useful resource for both machine learning and scientific communities.
研究动机与目标
- 为解决深度学习中分子标注数据稀缺的问题,通过综述化学预训练模型(CPMs)作为解决方案。
- 识别从零开始训练分子表征的局限性,包括数据稀缺性与分布外泛化能力差的问题。
- 系统性回顾CPM的各个组成部分:分子描述符、编码器架构、预训练目标及应用场景。
- 突出展示基准测试、模型泛化能力与CPM理论理解方面的开放性挑战。
- 通过识别如三维几何建模、统一架构设计以及超越单分子任务的广泛应用等未充分探索的研究方向,为未来研究提供指引。
提出的方法
- 系统性分类CPMs中使用的分子描述符,包括指纹、SMILES序列、二维/三维图结构及其各自的编码方法。
- 回顾图神经网络(GNNs)、Transformer(如GROVER、Graphomer)以及融合消息传递机制与注意力机制的混合模型等编码器架构。
- 分析对比学习(如GraphCL、GraphMVP)、掩码自编码器(如MCM)以及针对分子图的自监督目标等预训练策略。
- 在分子性质预测、药物-靶标相互作用及药物-药物相互作用预测等多样化下游任务中评估CPMs。
- 提出强调分布外泛化能力的评估框架,例如使用骨架拆分法与Therapeutics Data Commons(TDC)基准。
- 通过批判性分析不一致的评估协议及CPMs中理论基础的缺失,识别出方法论上的空白。
实验结果
研究问题
- RQ1关键的分子表征技术有哪些?它们在归纳偏置方面有何差异?
- RQ2不同编码器架构(如GNNs与Transformers)在捕捉分子结构与性质方面表现如何?
- RQ3哪些预训练目标最有效地学习到可泛化的分子表征?
- RQ4为何部分CPMs在分布外分子上表现不佳?如何缓解这一问题?
- RQ5在基准测试与理论理解方面存在哪些主要差距,阻碍了CPMs在实际应用中的采纳?
主要发现
- CPMs通过利用大规模无标注分子数据进行预训练,显著降低了对标注数据的依赖,使模型在下游任务中仅需极少微调即可实现优异性能。
- 尽管取得成功,CPMs仍因随机种子与数据集划分方式的差异,在小分子数据集(如MoleculeNet中的数据集)上表现出不一致的评估结果。
- 存在相互矛盾的结果——例如,尽管图注意力网络(GATs)广受欢迎,但其性能有时表现不佳——凸显了对更优架构设计与目标对齐的迫切需求。
- 对比学习与掩码自编码是主流的预训练策略,但其有效性因任务而异,部分研究甚至质疑其在某些场景下优于非预训练模型的优越性。
- Therapeutics Data Commons(TDC)为评估CPMs在多样化治疗任务中的表现提供了有前景的、贴近现实的基准,支持分布外泛化能力的测试。
- CPMs缺乏坚实的理论基础,对为何某些预训练目标能带来更好下游性能的理解极为有限,这构成了方法论可信度与实际采纳的障碍。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。