Skip to main content
QUICK REVIEW

[论文解读] Pre-trained Language Model for Biomedical Question Answering

Wonjin Yoon, Jinhyuk Lee|arXiv (Cornell University)|Sep 18, 2019
Topic Modeling参考文献 28被引用 5
一句话总结

本论文提出了一种基于BioBERT的问答系统,通过利用通用领域SQuAD数据集的迁移学习,提升了生物医学问答任务的性能。通过在事实型、列表型和是非题上采用一致的模型架构,并结合定制化的预处理和后处理策略,该系统在第七届BioASQ挑战赛(任务7b,阶段B)中取得了最先进性能,优于所有先前模型在各类问题类型上的表现。

ABSTRACT

The recent success of question answering systems is largely attributed to pre-trained language models. However, as language models are mostly pre-trained on general domain corpora such as Wikipedia, they often have difficulty in understanding biomedical questions. In this paper, we investigate the performance of BioBERT, a pre-trained biomedical language model, in answering biomedical questions including factoid, list, and yes/no type questions. BioBERT uses almost the same structure across various question types and achieved the best performance in the 7th BioASQ Challenge (Task 7b, Phase B). BioBERT pre-trained on SQuAD or SQuAD 2.0 easily outperformed previous state-of-the-art models. BioBERT obtains the best performance when it uses the appropriate pre-/post-processing strategies for questions, passages, and answers.

研究动机与目标

  • 通过使用领域特定的预训练语言模型,提升生物医学问答任务的性能。
  • 通过利用大规模通用领域问答数据集的迁移学习,解决生物医学问答数据标注有限的挑战。
  • 开发一种统一的模型架构,支持事实型、列表型和是非题,而无需结构上的更改。
  • 探究预处理和后处理策略对生物医学问答系统性能的影响。

提出的方法

  • 在SQuAD和SQuAD 2.0上微调BioBERT以进行迁移学习,随后在BioASQ数据集上进一步微调。
  • 使用单序列输入格式,通过[CLS]标记和段落嵌入区分问题和文本段落。
  • 针对事实型、列表型和是非题使用共享的BERT编码器架构,设计特定任务的输出层。
  • 实施预处理策略,包括针对生物医学术语的归一化和分词。
  • 应用后处理技术,如答案跨度过滤和概率阈值化,以优化预测结果。
  • 使用WordPiece分词方法处理生物医学词汇中的OOV词和子词单元。

实验结果

研究问题

  • RQ1在通用领域问答数据集(如SQuAD)上预训练BioBERT是否能提升其在生物医学问答任务上的性能?
  • RQ2具有最小结构变更的统一模型架构是否能在多种生物医学问题类型上有效运行?
  • RQ3不同的预处理和后处理策略如何影响生物医学问答系统的准确性和鲁棒性?
  • RQ4与仅使用SQuAD相比,从SQuAD 2.0进行迁移学习是否能进一步提升生物医学问答性能?

主要发现

  • 在SQuAD或SQuAD 2.0上预训练的BioBERT在BioASQ 7b阶段B挑战中显著优于先前的最先进模型。
  • 该系统在第七届BioASQ挑战赛的五个测试批次中均取得最佳性能,为事实型、列表型和是非题类型设定了新的最先进水平。
  • 采用合适的预处理和后处理策略带来了显著的性能提升,尤其在列表型问题中,错误跨度常通过阈值化被有效过滤。
  • 在事实型问题中,选择最高预测答案已足够;而在列表型问题中,需通过精细的后处理来处理多预测结果和错误跨度。
  • 该系统在各类问题类型中表现出强鲁棒性,仅使用单一共享模型结构和极少的架构修改,即保持了高性能。
  • 尽管某些错误预测具有较高置信度,但模型整体性能仍更优,表明通用领域预训练实现了有效的知识迁移。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。