Skip to main content
QUICK REVIEW

[论文解读] SuMe: A Dataset Towards Summarizing Biomedical Mechanisms

Mohaddeseh Bastan, N. Udaya Shankar|arXiv (Cornell University)|May 10, 2022
Biomedical Text Mining and Ontologies被引用 4
一句话总结

本文提出 SuMe,一个包含 22,000 个生物医学机制摘要实例的大规模数据集,源自科学摘要,采用少量专家标注的机制句子与微调分类器相结合的半自动自举方法构建。尽管在 611,000 个结论句子上进行预训练,最佳模型仅在 32% 的情况下生成可接受的机制摘要,凸显了生物医学语言理解与解释生成方面仍存在重大挑战。

ABSTRACT

Can language models read biomedical texts and explain the biomedical mechanisms discussed? In this work we introduce a biomedical mechanism summarization task. Biomedical studies often investigate the mechanisms behind how one entity (e.g., a protein or a chemical) affects another in a biological context. The abstracts of these publications often include a focused set of sentences that present relevant supporting statements regarding such relationships, associated experimental evidence, and a concluding sentence that summarizes the mechanism underlying the relationship. We leverage this structure and create a summarization task, where the input is a collection of sentences and the main entities in an abstract, and the output includes the relationship and a sentence that summarizes the mechanism. Using a small amount of manually labeled mechanism sentences, we train a mechanism sentence classifier to filter a large biomedical abstract collection and create a summarization dataset with 22k instances. We also introduce conclusion sentence generation as a pretraining task with 611k instances. We benchmark the performance of large bio-domain language models. We find that while the pretraining task help improves performance, the best model produces acceptable mechanism outputs in only 32% of the instances, which shows the task presents significant challenges in biomedical language understanding and summarization.

研究动机与目标

  • 通过实现复杂生物机制的自动化摘要,应对生物医学文献中日益严重的资讯过载挑战。
  • 开发一种可扩展的方法,用于创建无需完全依赖人工标注的高质量、大规模机制摘要数据集。
  • 探究大型语言模型是否能够准确生成科学文本中生化实体之间关系的机制解释。
  • 在一项新颖且复杂的任务(结合关系抽取与解释生成)上,对当前最先进的生物领域语言模型进行性能基准测试。
  • 识别并分析模型生成的机制摘要中的失败模式,以指导未来生物医学自然语言处理的改进。

提出的方法

  • 利用生物医学摘要中的结构化模式——支持性语句、结论性机制语句以及明确定义的实体(调节者与被调节者)——来定义摘要任务。
  • 使用一小部分专家标注的机制语句训练基于生物医学语言模型的机制语句分类器。
  • 将训练好的分类器应用于大规模语料(约 611,000 个摘要),自动识别并提取机制摘要实例,最终获得 22,000 个训练实例。
  • 引入一个预训练任务,专注于使用相同摘要生成结论句子,以提升下游机制生成性能。
  • 创建一个经人工校对的 125 个实例子集用于评估,专家标注质量达 84%,作为模型评估的基准。
  • 在 SuMe 数据集上微调当前最先进的生物领域语言模型,并通过自动指标与人工评估相结合的方式评估性能。

实验结果

研究问题

  • RQ1大型语言模型能否生成对生物医学摘要中描述的潜在生物机制的准确且忠实的摘要?
  • RQ2通过少量专家标注示例进行弱监督,在自举大规模机制摘要数据集方面有多高效?
  • RQ3在结论句子生成任务上进行预训练,在多大程度上能提升机制摘要的质量?
  • RQ4模型生成的机制摘要中主要的失败模式是什么?它们与实体追踪和关系理解有何关联?
  • RQ5当前最先进模型在此项复杂生物医学解释生成任务上的表现,与人类水平理解相比如何?

主要发现

  • 最佳模型仅在测试实例的 32% 中生成可接受的机制摘要,表明当前语言模型在该任务上仍面临极大挑战。
  • 最常见的错误类型是生成的机制语句中遗漏主要实体之一,占失败案例的 35%,表明在共指消解与实体追踪方面存在困难。
  • 错误的机制生成占失败案例的 24%,即模型生成了看似合理但缺乏事实依据或无关的解释。
  • 关系颠倒现象占失败案例的 19%,表明关系预测错误会显著降低机制生成质量。
  • 非机制输出(11%)与不完整机制(11%)进一步表明,模型在生成语义完整且准确的解释方面存在困难。
  • 支持性语句中出现因果或推理提示词(如“结合”、“导致”、“剂量依赖”、“表明”)与更高的模型置信度及更好的生成质量相关。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。