[论文解读] Biomedical Question Answering: A Survey of Approaches and Challenges
本综述全面概述了生物医学问答(BQA)领域,将现有方法分类为五类:经典方法、信息检索、机器阅读理解、知识库方法和问题蕴含方法。文章分析了关键数据集,评估了最先进方法,识别出主要挑战,如数据规模有限和标注质量低,并讨论了未来方向,包括改进评估指标和偏差缓解中的公平性问题。
Automatic Question Answering (QA) has been successfully applied in various domains such as search engines and chatbots. Biomedical QA (BQA), as an emerging QA task, enables innovative applications to effectively perceive, access and understand complex biomedical knowledge. There have been tremendous developments of BQA in the past two decades, which we classify into 5 distinctive approaches: classic, information retrieval, machine reading comprehension, knowledge base and question entailment approaches. In this survey, we introduce available datasets and representative methods of each BQA approach in detail. Despite the developments, BQA systems are still immature and rarely used in real-life settings. We identify and characterize several key challenges in BQA that might lead to this issue, and discuss some potential future directions to explore.
研究动机与目标
- 系统性地对生物医学问答(BQA)的五种主要方法——经典方法、信息检索、机器阅读理解、知识库方法和问题蕴含方法——进行分类与分析。
- 回顾现有BQA数据集,评估代表性模型,并评估不同任务类型(包括事实型、多选题和生成型问答)下的性能表现。
- 识别并表征BQA中的关键挑战,如标注数据有限、问题推理复杂度低以及评估指标的局限性。
- 考察BQA中的公平性与偏差问题,尤其关注词嵌入和医疗应用中历史数据偏差的影响。
- 探索未来研究方向,包括将生物医学知识库(如UMLS)整合到评估指标中,以及为低资源语言开发多语言BQA系统。
提出的方法
- 基于底层架构与方法论,将BQA系统划分为五类不同方法:经典方法、信息检索、机器阅读理解、知识库方法和问题蕴含方法。
- 回顾并比较各类方法中的代表性模型,包括BioBERT、基于BERT的MRC模型以及检索增强生成系统。
- 分析MRR、MAP、EM、F1、BLEU和ROUGE等评估指标,指出其在处理生物医学同义词与概念等价性方面存在的局限性。
- 提出将领域特定知识(如UMLS本体)整合到评估中,以反映生物医学术语的语义等价性。
- 通过分析词嵌入与上下文表示(如BERT)来考察BQA中的公平性与偏差问题,指出训练数据中存在性别与种族刻板印象。
- 讨论使用多语言及低资源BQA数据集(如中文、西班牙语、波斯语)以弥补BQA研究中非英语语言的空白。

实验结果
研究问题
- RQ1生物医学问答的五种主要方法是什么?它们在架构与性能上如何不同?
- RQ2与数据规模、标注质量及推理复杂度相关的BQA关键挑战有哪些?
- RQ3为何标准评估指标(如EM与F1)无法捕捉生物医学答案中的语义等价性?如何解决这一问题?
- RQ4词嵌入与预训练语言模型如何导致BQA系统中的偏差?这对临床决策支持有何影响?
- RQ5多语言与低资源BQA领域取得了哪些进展?非英语生物医学自然语言处理中仍存在哪些空白?
主要发现
- BioASQ基准测试显示性能随时间显著提升,顶尖模型在BioASQ 8中F1与MRR分别达到约50%,远高于BioASQ 1中的约20%。
- 大规模预训练语言模型(如BioBERT)已成为BQA领域的主导方法,最先进系统高度依赖此类模型。
- 当前评估指标(如EM与F1)因同义词问题(如“renal diseases”与“kidney diseases”)而无法识别概念上正确的答案,导致正确预测被低估。
- 采用UMLS或词向量相似性(如余弦相似度)的同义词评估方法可提升BQA评估的公平性与准确性,如Šuster与Daelemans(2018)所示。
- 词嵌入与上下文表示中的偏差(如类比中存在性别刻板印象)在BQA中仍是严重问题,尤其在医疗应用中更为突出。
- 由于缺乏领域特定资源与自然语言处理工具,非英语BQA发展滞后,尽管近期已推出针对中文、西班牙语与波斯语的数据集。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。