[论文解读] Modern Question Answering Datasets and Benchmarks: A Survey
本综述对深度学习时代出现的现代问答(QA)数据集与基准进行了全面分析,将其分类为文本、视觉(图像)和视频问答。通过任务类型、领域和所需推理能力对关键数据集进行评估,并识别出评估指标、模型可解释性、领域泛化能力以及问题多样性有限等关键挑战,为未来QA研究提供洞见。
Question Answering (QA) is one of the most important natural language processing (NLP) tasks. It aims using NLP technologies to generate a corresponding answer to a given question based on the massive unstructured corpus. With the development of deep learning, more and more challenging QA datasets are being proposed, and lots of new methods for solving them are also emerging. In this paper, we investigate influential QA datasets that have been released in the era of deep learning. Specifically, we begin with introducing two of the most common QA tasks - textual question answer and visual question answering - separately, covering the most representative datasets, and then give some current challenges of QA research.
研究动机与目标
- 提供对深度学习时代发布的重要问答(QA)数据集的系统性综述。
- 基于上下文类型和任务需求,按模态对QA数据集进行分类——文本、视觉(图像)和视频问答。
- 识别并分析当前QA研究中的挑战,包括评估指标、模型可解释性以及领域泛化能力。
- 突出数据集多样性方面的缺口,尤其是开放性问题与复杂推理问题的缺乏。
- 通过整合现有数据集及其局限性的洞察,为未来研究提供指导。
提出的方法
- 将QA数据集分为三种主要形式:文本问答(基于文本的上下文)、视觉问答(基于图像的上下文)和视频问答(基于视频的上下文)。
- 基于数据统计、领域、答案类型以及所需推理能力(如多跳推理、常识推理、逻辑推理等)分析每个数据集。
- 跨模态比较数据集,突出数据收集难度、标注成本和模型复杂度的差异。
- 评估数据集的代表性与质量,对比考试衍生问题(质量更高,数量有限)与人工标注问题(灵活性强但易出错)。
- 识别评估中的重复性问题,如过度依赖表面重叠(如F1、EM)而缺乏语义理解。
- 考察问题多样性方面的局限性,特别是与“什么”“何时”“何地”类问题相比,“为什么”和“如何”类开放性问题的稀缺性。
实验结果
研究问题
- RQ1最具影响力的文本、视觉和视频QA数据集有哪些?它们在数据规模、领域和所需推理能力方面有何差异?
- RQ2当前QA评估指标(如F1和EM)为何无法捕捉语义正确性,从而导致误判?
- RQ3为何模型在基准数据集上的表现与真实应用场景之间存在显著性能差距?
- RQ4视觉问答(VQA)中的关键挑战是什么,特别是在图像与视频理解方面,其与文本问答有何不同?
- RQ5当前QA数据集在支持复杂推理(如多跳推理、常识推理或逻辑推理)方面达到何种程度?在问题多样性方面存在哪些局限性?
主要发现
- 文本问答是研究最充分的模态,已识别出超过50个主要数据集,包括SQuAD、TriviaQA和HotpotQA,涵盖从新闻到科学等多样化领域。
- 最广泛使用的评估指标——F1和EM——依赖于词汇重叠,常无法捕捉语义正确性,导致模型性能评估不准确。
- 模型可解释性仍是重大问题,因为深度学习模型在QA中无法提供答案推导过程的解释,使其成为不可解释的黑箱。
- 存在显著的领域泛化差距:在SQuAD等基准上准确率超过90%的模型,在分布外或真实世界场景中常表现急剧下降。
- 当前数据集对开放性问题(如“为什么”和“如何”)代表性不足,这类问题需要更长、更复杂的答案,而大多数问题为封闭式,可用短语或选项作答。
- 视觉问答,尤其是视频问答,由于数据收集与标注成本更高、数据集可用性更低,且对视觉理解的要求远超物体识别,因此落后于文本问答。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。