[论文解读] ConditionalQA: A Complex Reading Comprehension Dataset with Conditional Answers
本文介绍了ConditionalQA,一个复杂的阅读理解数据集,其问题具有条件性答案——即仅在明确陈述的特定条件下才有效的答案。该数据集要求模型对长篇、逻辑复杂的文档进行多跳推理,当前最先进模型在是非问题上的准确率仅为64.9%,在抽取式答案上的精确匹配(EM)仅为25.2%,凸显了当前模型在处理条件逻辑推理方面存在显著差距。
We describe a Question Answering (QA) dataset that contains complex questions with conditional answers, i.e. the answers are only applicable when certain conditions apply. We call this dataset ConditionalQA. In addition to conditional answers, the dataset also features: (1) long context documents with information that is related in logically complex ways; (2) multi-hop questions that require compositional logical reasoning; (3) a combination of extractive questions, yes/no questions, questions with multiple answers, and not-answerable questions; (4) questions asked without knowing the answers. We show that ConditionalQA is challenging for many of the existing QA models, especially in selecting answer conditions. We believe that this dataset will motivate further research in answering complex questions over long documents. Data and leaderboard are publicly available at \url{https://github.com/haitian-sun/ConditionalQA}.
研究动机与目标
- 为填补现有阅读理解数据集的空白,这些数据集通常包含确定性答案,提出一种具有条件性答案的数据集,其答案依赖于特定的上下文相关条件。
- 创建一个基准,用于测试模型在长篇、具有复杂内部依赖关系的逻辑结构化文档上执行多跳推理的能力。
- 评估当前最先进问答模型在需要识别答案及其关联条件的问题上的表现,揭示其在推理与条件选择方面的局限性。
- 在标注过程中将问题提出与答案选择过程解耦,确保问题在不知晓答案的情况下提出,从而提升真实性和多样性。
提出的方法
- 该数据集源自英国的真实公共政策文件,聚焦于社会福利项目(如丧葬费用补贴),其资格标准涉及复杂的条件性逻辑。
- 每个样本包含一个用户问题、一个情景描述、一份长篇政策文件以及人工标注的支持性证据,且答案与所需条件明确配对。
- 问题类型多样:抽取式、是非题、多答案题和不可回答题,反映现实世界中用户查询的模糊性与不完整性。
- 标注过程将问题创建与答案选择分离,确保问题在不知道答案的情况下提出,从而提升真实性和减少偏差。
- 模型评估同时关注答案准确率与条件准确率,通过联合评估答案与条件来衡量整体推理性能。
- 基线模型包括检索增强编码器(如 ETC-pipeline、DocHopper)和一个生成式模型(FiD),性能通过答案与条件的精确匹配(EM)和F1分数进行衡量。
实验结果
研究问题
- RQ1现有问答模型能否正确识别在复杂政策文件中仅在特定明确陈述条件下才有效的答案?
- RQ2当前模型在需要跨多个逻辑依赖关系在长篇结构化文档中进行多跳推理的问题上表现如何?
- RQ3模型在答案条件选择上失败的程度如何?其在条件答案预测中的主要错误模式是什么?
- RQ4与仅预测答案相比,联合预测答案与条件时,模型性能是否显著下降?
- RQ5通过调整置信度分数的阈值,能否在不引入过多假阳性结果的前提下提升条件答案的预测效果?
主要发现
- 表现最佳的模型在是非问题上的准确率仅为64.9%,仅略高于始终预测“是”的多数基线(62.2%)的准确率。
- 在抽取式问题上,最佳模型的精确匹配(EM)仅为25.2%,表明其在识别正确答案片段方面存在显著困难。
- 在联合评估答案与条件时,最佳模型在是非问题上的EM降至49.1%,在抽取式问题上降至22.5%,且当不预测任何条件时性能最佳。
- 当联合预测条件时,包含至少一个条件答案的问题性能下降超过90%,凸显了条件选择的极端难度。
- 错误分析显示,最常见的错误是仅预测了部分正确答案,尤其因模型倾向于输出单答案,即使存在多个有效答案。
- 对条件置信度分数进行阈值调优在仅包含条件答案的子集上带来微弱改善,但因引入了大量假阳性条件,导致整体性能急剧下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。