Skip to main content
QUICK REVIEW

[论文解读] An LLM-based Knowledge Synthesis and Scientific Reasoning Framework for Biomedical Discovery

Oskar Wysocki, Magdalena Wysocka|arXiv (Cornell University)|Jun 26, 2024
Biomedical Text Mining and OntologiesBiochemistry, Genetics and Molecular Biology被引用 3
一句话总结

本文介绍了 BioLunar,这是一个基于 Lunar 平台构建的低代码、大语言模型(LLM)驱动的框架,使生物医学研究人员能够为肿瘤学生物标志物发现构建人工智能驱动的科学工作流。通过整合检索增强生成(RAG)、工具形式化(toolformers)和自然语言蕴含(NLI),BioLunar 从数据库和 PubMed 中综合异构证据,自动实现基因集的解释,展示了其能够生成具有上下文关联性的、基于证据的丰富摘要,识别出已知和新型生物标志物。

ABSTRACT

We present BioLunar, developed using the Lunar framework, as a tool for supporting biological analyses, with a particular emphasis on molecular-level evidence enrichment for biomarker discovery in oncology. The platform integrates Large Language Models (LLMs) to facilitate complex scientific reasoning across distributed evidence spaces, enhancing the capability for harmonizing and reasoning over heterogeneous data sources. Demonstrating its utility in cancer research, BioLunar leverages modular design, reusable data access and data analysis components, and a low-code user interface, enabling researchers of all programming levels to construct LLM-enabled scientific workflows. By facilitating automatic scientific discovery and inference from heterogeneous evidence, BioLunar exemplifies the potential of the integration between LLMs, specialised databases and biomedical tools to support expert-level knowledge synthesis and discovery.

研究动机与目标

  • 解决将异构、分布式的生物医学证据(例如来自数据库、文献和组学数据)整合为连贯、可解释的见解以支持生物标志物发现的挑战。
  • 降低非程序员在构建复杂、增强大语言模型的肿瘤学科学工作流方面的入门门槛。
  • 通过结合大语言模型与经过整理的知识库及外部分析工具,实现实验室自动化、可重复且上下文感知的科学推理。
  • 通过证据综合,特别是在新型或研究不足的基因方面,支持癌症研究中的假说生成。

提出的方法

  • 该框架基于 Lunar 协调框架构建,支持使用标准化 API 的大语言模型组件的模块化组合。
  • 采用检索增强生成(RAG)技术,利用经过整理的知识库(如 OncoKB、KEGG、PubMed)和外部数据库,检索并锚定大语言模型的推理结果。
  • 使用 Toolformer 组件与外部分析工具(如基因富集分析和通路分析工具,例如 KEGG、OncoKB)进行接口对接。
  • 通过大语言模型实现的自然语言蕴含(NLI)技术,将来自不同来源的证据整合并统一,生成一致且可解释的摘要。
  • 系统支持预构建组件以及通过“Python Coder”和“R Coder”组件实现的自定义代码,从而实现可扩展性。
  • 低代码用户界面使领域专家无需编程即可组装工作流,同时保持完全可重复性和溯源追踪。
Figure 1: BioLunar interface. An exemplary workflow of Gene Enrichment with an input gene set, knowledge base query and LLM interpretation components.
Figure 1: BioLunar interface. An exemplary workflow of Gene Enrichment with an input gene set, knowledge base query and LLM interpretation components.

实验结果

研究问题

  • RQ1基于大语言模型的框架能否有效整合并推理异构的生物医学证据源,以支持肿瘤学中的生物标志物发现?
  • RQ2如何在模块化、可重用的工作流系统中编排大语言模型,以增强科学推理,而无需专家级编程?
  • RQ3此类系统在多大程度上能够通过整合结构化数据库和非结构化文献中的证据,识别出已知和新型生物标志物?
  • RQ4在生物医学工作流中集成 RAG 和 toolformers 是否能提高大语言模型生成解释的准确性和上下文相关性?

主要发现

  • 在场景1中,BioLunar 成功识别并语境化了乳腺癌中的已知生物标志物(PIK3CA 和 ESR1),并通过 OncoKB 和 KEGG 中的证据确认了其临床相关性。
  • 对于新型基因(DIXDC1、DUSP6、PDK4、CXCL12、IRF7、ITGA7、NEK2、NR3C1),工作流检测到知识库中无先前的分子谱数据,从而触发了针对性的 PubMed 检索。
  • PubMed 检索揭示了近期发表的文献,将这些新型基因与乳腺癌相关联,证明了该系统能够发现此前未知或报道不足的生物标志物候选。
  • 基于 KEGG 的富集分析表明,这些新型基因在肿瘤坏死因子(TNF)信号通路中显著富集,提示其潜在的功能相关性。
  • 其中两个新型基因被识别为潜在药物靶点,一个被确认为 FDA 批准的药物靶点,凸显了研究发现的临床可转化性。
  • 该框架成功生成了全面、基于证据的报告,将结论与源数据关联,实现了可重复且透明的科学推理。
Figure 2: A) Gene Enrichment workflow - uses the gprofiler API to access i.a. Gene Ontology, KEGG, WikiPathways, Reactome; B) Human Protein Atlas workflow. Compares and interprets the input and reference gene sets.
Figure 2: A) Gene Enrichment workflow - uses the gprofiler API to access i.a. Gene Ontology, KEGG, WikiPathways, Reactome; B) Human Protein Atlas workflow. Compares and interprets the input and reference gene sets.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。