[论文解读] Transformer-Based Models for Question Answering on COVID19
本文提出三种基于Transformer的问答系统,分别采用BERT、ALBERT和T5模型,针对CORD-19数据集进行构建,结合语义检索(SBERT或LDA)与微调后的问答头。在CovidQA和CovidGQA基准上,BERT-large取得最高的F1分数(26.32),而ALBERT-base则取得最高的精确匹配(13.04),展现出在标注数据有限情况下的优异性能。
In response to the Kaggle's COVID-19 Open Research Dataset (CORD-19) challenge, we have proposed three transformer-based question-answering systems using BERT, ALBERT, and T5 models. Since the CORD-19 dataset is unlabeled, we have evaluated the question-answering models' performance on two labeled questions answers datasets extemdash CovidQA and CovidGQA. The BERT-based QA system achieved the highest F1 score (26.32), while the ALBERT-based QA system achieved the highest Exact Match (13.04). However, numerous challenges are associated with developing high-performance question-answering systems for the ongoing COVID-19 pandemic and future pandemics. At the end of this paper, we discuss these challenges and suggest potential solutions to address them.
研究动机与目标
- 解决在标注数据有限的情况下,针对快速增长的COVID-19文献开发高性能问答系统所面临的挑战。
- 在标注数据有限的条件下,评估基于Transformer的模型(BERT、ALBERT、T5)在生物医学问答任务中的表现。
- 构建混合问答系统,结合语义检索(SBERT或LDA)与微调后的Transformer问答模型,以提升准确率与效率。
- 通过整合检索模块与神经问答组件,提升模型在医疗用户中的可信度与可解释性。
- 通过迁移学习与少样本适应,为未来具备疫情应对能力的问答系统奠定基础。
提出的方法
- 在SQuAD v1.1、SNLI、MultiNLI、STS以及BioASQ事实型问答数据集上微调BERT-large、ALBERT-base和T5-large,以预训练问答能力。
- 构建SBERT-BERT-QA系统,利用Sentence-BERT基于查询嵌入与文章标题之间的相似性,实现相关文章的语义检索。
- 构建LDA-ALBERT-QA系统,利用LDA在输入到微调后的ALBERT-base-uncased问答模型前,对文档进行相关性过滤。
- 在ALBERT模型之上使用token级分类头,预测在检索到的文档中答案跨度的起始与结束索引。
- 在两个生物医学问答基准(CovidQA与CovidGQA)上评估模型性能,采用F1与精确匹配(EM)作为评价指标。
- 首先在SQuAD v1.1上预训练ALBERT,以应对数据稀缺问题,随后在BioASQ 6b事实型问答对上进一步微调,实现生物医学领域的适应。
实验结果
研究问题
- RQ1BERT、ALBERT与T5模型在低资源生物医学问答任务中的表现如何?
- RQ2结合SBERT或LDA与Transformer问答模型的混合检索-问答系统,是否能提升针对CORD-19相关问题的性能?
- RQ3为何T5-large尽管参数量(770 million)高于BERT-large与ALBERT-base,却在所有指标上表现欠佳?
- RQ4当前基于Transformer的问答系统在医疗NLP中的关键局限性是什么,尤其是在数据稀缺与可解释性方面?
- RQ5少样本学习与领域特定预训练如何提升在疫情相关研究中的问答性能?
主要发现
- BERT-large在CovidQA数据集上取得最高的F1分数(26.32),优于ALBERT-base与T5-large。
- ALBERT-base在相同数据集上取得最高的精确匹配(EM)分数(13.04),表明其在答案跨度抽取方面具有更高的精确度。
- 尽管参数量达770 million,T5-large在所有指标上均表现逊于BERT-large与ALBERT-base,可能由于缺乏针对问答任务的预训练。
- SBERT-BERT-QA系统通过查询与标题嵌入之间的语义相似性,有效检索出相关文章,从而提升了下游问答的准确率。
- LDA-ALBERT-QA系统利用主题建模在问答推理前过滤无关文档,提升了检索的相关性。
- 本研究表明,模型性能并非仅由参数量决定,领域特定的预训练显著提升了生物医学问答的表现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。