[论文解读] A generalizable framework for unlocking missing reactions in genome-scale metabolic networks using deep learning
本文提出 CLOSEgaps,一种深度学习框架,将基因组尺度代谢网络建模为超图,以在不依赖表型数据的情况下预测草案 GEM 中缺失的反应。通过整合超图卷积网络与注意力机制,其在多种生物体中实现超过 96% 的准确率,显著提升表型预测能力及关键代谢物的产量。
Incomplete knowledge of metabolic processes hinders the accuracy of GEnome-scale Metabolic models (GEMs), which in turn impedes advancements in systems biology and metabolic engineering. Existing gap-filling methods typically rely on phenotypic data to minimize the disparity between computational predictions and experimental results. However, there is still a lack of an automatic and precise gap-filling method for initial state GEMs before experimental data and annotated genomes become available. In this study, we introduce CLOSEgaps, a deep learning-driven tool that addresses the gap-filling issue by modeling it as a hyperedge prediction problem within GEMs. Specifically, CLOSEgaps maps metabolic networks as hypergraphs and learns their hyper-topology features to identify missing reactions and gaps by leveraging hypothetical reactions. This innovative approach allows for the characterization and curation of both known and hypothetical reactions within metabolic networks. Extensive results demonstrate that CLOSEgaps accurately gap-filling over 96% of artificially introduced gaps for various GEMs. Furthermore, CLOSEgaps enhances phenotypic predictions for 24 GEMs and also finds a notable improvement in producing four crucial metabolites (Lactate, Ethanol, Propionate, and Succinate) in two organisms. As a broadly applicable solution for any GEM, CLOSEgaps represents a promising model to automate the gap-filling process and uncover missing connections between reactions and observed metabolic phenotypes.
研究动机与目标
- 解决基因组尺度代谢模型(GEM)中持续存在的知识不完整问题,该问题限制了其在系统生物学与代谢工程中的准确性和实用性。
- 克服传统缺隙填补方法依赖昂贵、耗时的表型筛选与人工校对的局限性。
- 开发一种无需模型、基于数据的方法,可在实验数据或注释基因组可用之前,识别草案 GEM 中的缺失反应。
- 为任何生物体(包括非模式生物或不可培养物种)提供自动化、可扩展且通用的缺隙填补方法。
- 通过准确恢复缺失的代谢连接并提升通量平衡分析结果,增强 GEM 的预测能力。
提出的方法
- 将代谢网络表示为超图,其中超边对应反应,超节点代表代谢物,从而实现对复杂反应-代谢物关系的拓扑建模。
- 采用具有可学习参数的超图卷积网络(HGCN),从超图结构中提取分层拓扑特征。
- 集成注意力机制,在特征传播过程中动态加权邻近超边与代谢物的重要性。
- 将缺隙填补问题形式化为超链接预测:利用二分类头基于学习到的超边表示,预测假设反应的存在或缺失。
- 使用相似性函数(公式 3)计算节点与超边之间的注意力权重,实现上下文感知的表征学习。
- 采用置信度阈值 0.99999 对 BiGG 数据库中的候选反应进行排序,并通过通量边界调整迭代检测并消除能量生成循环(EGCs),每次添加前 200 个反应。
实验结果
研究问题
- RQ1能否在无需先前表型数据或人工校对的情况下,利用深度学习框架预测草案 GEM 中的缺失反应?
- RQ2基于超图的表征学习方法在捕捉代谢网络拓扑特征以实现缺隙填补方面效果如何?
- RQ3该方法在多种生物体的多个 GEM 中,对表型预测准确性的提升程度如何?
- RQ4该框架能否识别出与关键代谢物(如乳酸、乙醇、丙酸、延胡索酸)产量提升相关的生物相关缺失反应?
- RQ5该方法在不同生物体(包括非模式生物与不可培养物种)中的通用性如何?
主要发现
- CLOSEgaps 在多个基因组尺度代谢模型中对人工引入的缺隙实现了超过 96% 的准确率,证明了其高度可靠的预测能力。
- 该框架显著提升了 24 种不同 GEM 的表型预测准确率,表明模型保真度与功能覆盖范围得到增强。
- 在两种生物体中,CLOSEgaps 通过识别并整合缺失反应,显著提升了四种关键代谢物——乳酸、乙醇、丙酸与延胡索酸——的计算机模拟产量。
- 采用严格的置信度阈值(0.99999)与迭代 EGC 检测,确保了高质量的缺隙填补,同时避免了代谢不一致。
- 该方法成功识别出 15 个能量耗散反应(如 ATP、GTP 相关反应),对消除重构模型中的虚假通量循环至关重要。
- 该框架可广泛应用于任意 GEM,无论生物体类型如何,且在缺乏实验表型数据的情况下仍能有效运行。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。