Skip to main content
QUICK REVIEW

[论文解读] Archive of PubTator 3.0 source code and trained models

Chih-Hsuan Wei, Alexis Allot|PubMed|Jan 19, 2024
Biomedical Text Mining and OntologiesBiochemistry, Genetics and Molecular Biology被引用 3
一句话总结

PubTator 3.0 是一个基于人工智能的生物医学文献资源,利用最先进的自然语言处理模型,对 3600 万篇 PubMed 摘要和 600 万篇 PMC 全文文章中的超过 10 亿个实体和关系进行了注释。该系统支持更高精度和更高召回率的语义搜索与关系搜索,优于 PubMed 或 Google Scholar,且可通过 API 与大型语言模型(如 GPT-4)集成,提升 AI 回答的事实准确性和可验证性。

ABSTRACT

PubTator 3.0 (https://www.ncbi.nlm.nih.gov/research/pubtator3/) is a biomedical literature resource using state-of-the-art AI techniques to offer semantic and relation searches for key concepts like proteins, genetic variants, diseases, and chemicals. It currently provides over one billion entity and relation annotations across approximately 36 million PubMed abstracts and 6 million full-text articles from the PMC open access subset, updated weekly. PubTator 3.0's online interface and API utilize these precomputed entity relations and synonyms to provide advanced search capabilities and enable large-scale analyses, streamlining many complex information needs. We showcase the retrieval quality of PubTator 3.0 using a series of entity pair queries, demonstrating that PubTator 3.0 retrieves a greater number of articles than either PubMed or Google Scholar, with higher precision in the top 20 results. We further show that integrating ChatGPT (GPT-4) with PubTator APIs dramatically improves the factuality and verifiability of its responses. In summary, PubTator 3.0 offers a comprehensive set of features and tools that allow researchers to navigate the ever-expanding wealth of biomedical literature, expediting research and unlocking valuable insights for scientific discovery.

研究动机与目标

  • 为应对生物医学文献量呈指数级增长所带来的信息导航挑战,实现高效、语义感知的信息检索。
  • 开发一种可扩展的、基于人工智能的系统,自动标注科学文献中的关键生物医学实体及其关系。
  • 在精度和召回率方面超越传统基于关键词的检索系统(如 PubMed 和 Google Scholar),提升文献检索性能。
  • 与大型语言模型集成,提升生物医学语境下 AI 生成回答的事实可靠性与可验证性。
  • 为研究人员提供一个公开可访问、持续更新且可扩展的资源,以加速生物医学知识发现。

提出的方法

  • 系统采用在生物医学语料上微调的先进深度学习模型,用于提取和分类蛋白质、疾病、化学物质和基因变异等实体。
  • 应用神经关系抽取模型,识别文本中已标注实体之间的语义关系,如蛋白质-疾病关系或药物-化学物质相互作用。
  • 对 3600 万篇 PubMed 摘要和 600 万篇 PMC 全文文章组成的综合性语料库进行预计算并建立索引,每周更新一次。
  • 系统提供在线界面和程序化 API,支持使用实体同义词和标准化标识符的语义及关系查询。
  • 通过 API 调用与 GPT-4 集成,验证并优化 LLM 生成的回答,提升其事实一致性与对源文献的可追溯性。
  • 该处理流程利用在生物医学文本上预训练的大规模语言模型进行迁移学习,实现高性能的同时仅需极少的微调。

实验结果

研究问题

  • RQ1与 PubMed 和 Google Scholar 相比,基于人工智能的系统是否能在生物医学文献检索中实现更高的精度和召回率?
  • RQ2预计算的实体与关系注释在多大程度上能提升生物医学文献中语义搜索的效率与准确性?
  • RQ3将 GPT-4 等大型语言模型与 PubTator 3.0 这类经过精心整理的知识库集成,如何提升 AI 生成答案的事实准确性和可验证性?
  • RQ4一个可扩展的自动化系统是否能在一个大规模、动态更新的生物医学文献语料库中保持高质量的注释?
  • RQ5同义词归一化与实体链接在复杂生物医学查询中的语义搜索有效性方面有何影响?

主要发现

  • 对于实体对查询,PubTator 3.0 在前 20 项结果中的精度更高,检索到的相关文献数量显著多于 PubMed 或 Google Scholar。
  • 系统在 3600 万篇摘要和 600 万篇全文字文章中实现了超过 10 亿个实体和关系的注释。
  • 通过 API 将 GPT-4 与 PubTator 3.0 集成后,生成的回答在事实一致性与可验证性方面优于独立使用 LLM 推理的结果。
  • 预计算的注释支持低延迟、可扩展的语义搜索,适用于大规模数据分析与知识发现。
  • 系统每周更新,确保用户可访问最新生物医学文献,并保持一致的实体与关系标注。
  • 使用标准化实体标识符与同义词映射,显著提升了跨文档实体链接与查询解析的准确性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。