Skip to main content
QUICK REVIEW

[论文解读] MOLIERE: Automatic Biomedical Hypothesis Generation System

Justin Sybrandt, Michael Shtutman|arXiv (Cornell University)|Feb 20, 2017
Biomedical Text Mining and Ontologies参考文献 26被引用 13
一句话总结

MOLIERE 是一个大规模、开源的生物医学假说生成系统,它从 2450 万篇 MEDLINE 文档和 NCBI 数据集中构建一个多模态、多关系网络,利用最短路径发现和基于 LDA 的主题建模方法对这些路径附近的文摘进行分析,从而生成可解释、人类可读的假说。该系统通过利用全文数据且无词汇限制,优于以往的系统,成功复现了诸如 DDX3 在癌症治疗中作用等标志性发现。

ABSTRACT

Hypothesis generation is becoming a crucial time-saving technique which allows biomedical researchers to quickly discover implicit connections between important concepts. Typically, these systems operate on domain-specific fractions of public medical data. MOLIERE, in contrast, utilizes information from over 24.5 million documents. At the heart of our approach lies a multi-modal and multi-relational network of biomedical objects extracted from several heterogeneous datasets from the National Center for Biotechnology Information (NCBI). These objects include but are not limited to scientific papers, keywords, genes, proteins, diseases, and diagnoses. We model hypotheses using Latent Dirichlet Allocation applied on abstracts found near shortest paths discovered within this network, and demonstrate the effectiveness of MOLIERE by performing hypothesis generation on historical data. Our network, implementation, and resulting data are all publicly available for the broad scientific community.

研究动机与目标

  • 为应对生物医学文献中的信息过载挑战,通过从海量异构数据中自动化生成假说。
  • 克服以往系统在词汇、领域或数据范围上的限制,从而避免遗漏隐含关联。
  • 构建一个可扩展、通用的系统,能够从全文摘要中生成可解释、基于证据的假说。
  • 提供公开可用的开源知识网络和查询接口,以加速生物医学发现。
  • 通过复现已知的标志性生物医学发现,在历史数据上验证该系统。

提出的方法

  • 从 MEDLINE 和 NCBI 数据集中构建生物医学对象(基因、疾病、蛋白质、关键词等)的多模态、多关系网络。
  • 使用 SPECIALIST NLP 工具集对文摘和标题中的实体和关系进行标准化和提取。
  • 应用最短路径算法,通过中间节点识别查询概念之间的非平凡关联。
  • 提取这些路径附近的文摘,并应用 PLDA+(一种可扩展的 LDA 变体)对主题进行建模,无需预定义词汇表。
  • 采用主题短语挖掘方法识别有意义的 n-gram,提升主题模型的可解释性和灵活性。
  • 通过结合主题模型与发现路径周围的上下文文摘,生成人类可读的假说摘要。

实验结果

研究问题

  • RQ1一个假说生成系统是否能有效挖掘整个 MEDLINE 语料库中隐含的关系,而无需限制词汇或领域?
  • RQ2基于最短路径和基于 LDA 的主题建模的系统,在多大程度上能复现具有历史意义的生物医学发现?
  • RQ3与基于关键词的系统相比,使用全文摘要和语义短语挖掘在多大程度上提升了假说的质量和可解释性?
  • RQ4基于异构、真实世界生物医学数据构建的系统,是否能产生可靠、可复现且新颖的假说?
  • RQ5当该系统应用于完整的 2450 万篇文档数据集时,其性能如何扩展?

主要发现

  • MOLIERE 成功复现了关于 DEAD-box RNA 解旋酶 3(DDX3)在癌症治疗中作用的有力证据,所用数据截至 2009 年。
  • 该系统展示了通过结合主题建模与最短路径周围的文摘,生成可解释、人类可读假说的能力。
  • 通过采用主题短语挖掘避免词汇限制,MOLIERE 提升了其基于 LDA 的主题模型的灵活性和可理解性。
  • 该系统通过利用整个 MEDLINE 语料库而非受限子集或人工整理的词汇表,优于以往方法。
  • 知识网络和查询接口公开可用,支持可复现性与更广泛的科学应用。
  • 在历史数据上的评估证实,MOLIERE 具备识别标志性发现的能力,验证了其在生物医学知识发现中的实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。