[论文解读] QuALITY: Question Answering with Long Input Texts, Yes!
QuALITY 引入了一个多选题问答数据集,包含平均约 5,000 个标记的长英文段落,旨在测试整体理解能力,而非表面检索。该数据集采用双重标注流程——标准验证与限时验证——以确保问题需要深度理解,从而在模型(55.4%)与人类(93.5%)之间产生显著性能差距,凸显了自然语言处理中长上下文理解的挑战。
To enable building and testing models on long-document comprehension, we introduce QuALITY, a multiple-choice QA dataset with context passages in English that have an average length of about 5,000 tokens, much longer than typical current models can process. Unlike in prior work with passages, our questions are written and validated by contributors who have read the entire passage, rather than relying on summaries or excerpts. In addition, only half of the questions are answerable by annotators working under tight time constraints, indicating that skimming and simple search are not enough to consistently perform well. Our baseline models perform poorly on this task (55.4%) and significantly lag behind human performance (93.5%).
研究动机与目标
- 解决当前缺乏高质量长文档问答基准的问题,这些基准要求整体理解而非浅层检索。
- 创建一个数据集,其中问题由已完整阅读文章的读者编写并验证,以确保上下文深度和答案的无歧义性。
- 设计一种众包流程,通过比较限时与非限时条件下的表现,识别出需要完整段落理解的问题。
- 评估当前模型在处理长上下文时的局限性,特别是当需要跨多个部分进行推理时。
- 建立一个基准,将模型能力的挑战推向短上下文能力之外,推动长上下文自然语言处理的前沿。
提出的方法
- 一种众包流程,作者阅读整篇段落并为每篇文章创建 10 个问题,确保问题无歧义且需要整合文本中的多处信息。
- 每个问题由五名非限时标注者(可完整阅读段落)和五名限时标注者(仅 45 秒时间作答)进行验证,模拟基于快速浏览的搜索行为。
- 若非限时标注者正确回答而限时标注者未能正确回答,则将问题归类为“困难”,表明其需要超越关键词搜索的深度理解。
- 数据集采用多选题格式,以简化评估并避免生成式回答指标带来的歧义。
- 基线模型使用 RoBERTa、DeBERTaV3 和 Longformer 架构在 QuALITY 上进行微调,采用标准微调协议。
- 采用基于“最优答案”的检索方法,以分离检索与阅读组件的贡献,结果表明即使使用完美答案,模型性能仍显著偏低。
实验结果
研究问题
- RQ1当模型必须整合整个段落的信息而非依赖短篇片段时,能否在长文档问答任务中取得高准确率?
- RQ2与人类读者相比,当前模型在理解长上下文方面失败的程度如何?导致这一差距的因素有哪些?
- RQ3双重标注流程(限时与非限时验证)在识别需要整体理解的问题方面有多有效?
- RQ4多选题格式能否在避免生成式评估指标歧义的前提下,有效评估长上下文理解能力?
- RQ5在长上下文任务中,两阶段问答模型的检索与阅读组件各自贡献了多少?
主要发现
- 表现最佳的基线模型 DeBERTaV3-large 在 QuALITY 完整开发集上的准确率仅为 71.9%,远低于人类表现。
- 人类在 QuALITY 上的准确率为 93.5%,表明模型与最佳模型之间存在 38.1% 的显著性能差距。
- 即使使用最优答案作为查询,最佳模型的准确率也仅为 77.8%,表明在长上下文设置中,检索与阅读组件均具挑战性。
- 基于词汇重叠的启发式方法(将答案选项与文本匹配)仅达到 26.6% 的准确率,证明模型无法依赖简单的表面匹配。
- 通过限时验证识别出的“困难”问题显著更具挑战性:模型在这些问题上表现较差,且必须完整理解段落才能作答。
- RACE 基准(使用较短上下文)的性能显著更低(DeBERTaV3-large 为 57.5%),表明 QuALITY 的长上下文设计显著提升了任务难度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。