[论文解读] Modern Hopfield Networks for Few- and Zero-Shot Reaction Template Prediction
本论文提出使用现代霍普菲尔德网络(MHNs)进行少样本和零样本反应模板预测,通过学习的记忆模式建模分子与模板之间的关联。通过同时编码分子和模板,并利用霍普菲尔德层检索相关模板,该方法在USPTO-50k数据集上实现了最先进(SOTA)的top-k精确匹配准确率,尤其在训练数据极少的罕见模板上表现显著提升,同时推理速度比基线模型快数倍。
Finding synthesis routes for molecules of interest is an essential step in the discovery of new drugs and materials. To find such routes, computer-assisted synthesis planning (CASP) methods are employed which rely on a model of chemical reactivity. In this study, we model single-step retrosynthesis in a template-based approach using modern Hopfield networks (MHNs). We adapt MHNs to associate different modalities, reaction templates and molecules, which allows the model to leverage structural information about reaction templates. This approach significantly improves the performance of template relevance prediction, especially for templates with few or zero training examples. With inference speed several times faster than that of baseline methods, we improve predictive performance for top-k exact match accuracy for $\\mathrm{k}\\geq5$ in the retrosynthesis benchmark USPTO-50k.
研究动机与目标
- 为解决模板化逆合成中低数据性能的问题,特别是针对罕见或未见的反应模板。
- 通过在现代霍普菲尔德网络中将分子和模板表征建模为相互关联的记忆模式,改进模板相关性预测。
- 在无需为每个模板依赖大规模标注数据的情况下,实现在化学反应模板预测中的有效少样本和零样本学习。
- 开发一种可扩展的、可微分的架构,在保持高推理速度的同时显著提升top-k精确匹配准确率,尤其在k ≥ 5时表现更优。
- 通过联合编码和关联检索,利用反应模板和分子中的结构信息,构建一种可扩展的、可微分的架构。
提出的方法
- 模型使用独立的编码器对分子和反应模板进行编码,将其映射到潜在表征空间。
- 通过现代霍普菲尔德网络层计算关联检索,将编码后的分子表征与存储的模板编码模式进行匹配。
- 霍普菲尔德层采用基于相似度的注意力机制计算更新后的状态模式,其中查询为分子嵌入,键为模板嵌入。
- 模型通过模板预测的交叉熵损失或一种新颖的基于模式的损失函数进行训练,后者旨在最大化正确模板关联的期望得分。
- 该架构支持堆叠多个霍普菲尔德层,并可通过反向传播实现端到端优化。
- 其他损失函数包括InfoNCE,其通过对比检索模式与正确模板的相似性与负样本模板的相似性,提升低数据场景下的鲁棒性。
实验结果
研究问题
- RQ1现代霍普菲尔德网络能否有效建模分子-模板关联,以实现少样本和零样本的逆合成反应模板预测?
- RQ2与标准分类模型相比,所提出的基于MHN的方法在罕见反应模板上的表现如何?
- RQ3MHN中的关联记忆机制是否能在无需大量微调的情况下提升对未见模板的泛化能力?
- RQ4与交叉熵损失相比,使用基于模式的损失函数对模型性能和鲁棒性有何影响?
- RQ5该模型是否能在保持或提升USPTO-50k等基准数据集上top-k精确匹配准确率的同时,实现高推理速度?
主要发现
- 所提出的基于MHN的模型在USPTO-50k逆合成基准上实现了最先进性能,尤其在k ≥ 5时显著提升了top-k精确匹配准确率。
- 该模型在罕见模板上的表现显著优于基线方法,展现出强大的少样本和零样本泛化能力。
- 推理速度比基线模型快数倍,适用于高效集成到合成规划工作流中。
- 基于模式的损失函数在性能上可与交叉熵损失相媲美,且在低数据场景下表现出更强的鲁棒性。
- 通过关联记忆机制将分子与模板关联的能力,使模型在每模板训练数据有限时仍能实现更优泛化。
- 该方法通过将反应模板编码为独立的记忆模式,有效利用了模板中的结构信息,从而提升了预测准确性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。