[论文解读] Think you have Solved Direct-Answer Question Answering? Try ARC-DA, the Direct-Answer AI2 Reasoning Challenge
本文提出了ARC-DA,即ARC(AI2 Reasoning Challenge)数据集的直接回答(开放式回答)版本,通过众包和专家评审,将专家构建的多项选择科学问题转化为自由格式的回答。尽管基线模型表现强劲(GENIE得分为81%,ROUGE-L得分为63.2%),但结果揭示了仍有显著提升空间,表明ARC-DA是推理型问答在自然、非多项选择格式下的一个具有挑战性的基准。
We present the ARC-DA dataset, a direct-answer ("open response", "freeform") version of the ARC (AI2 Reasoning Challenge) multiple-choice dataset. While ARC has been influential in the community, its multiple-choice format is unrepresentative of real-world questions, and multiple choice formats can be particularly susceptible to artifacts. The ARC-DA dataset addresses these concerns by converting questions to direct-answer format using a combination of crowdsourcing and expert review. The resulting dataset contains 2985 questions with a total of 8436 valid answers (questions typically have more than one valid answer). ARC-DA is one of the first DA datasets of natural questions that often require reasoning, and where appropriate question decompositions are not evident from the questions themselves. We describe the conversion approach taken, appropriate evaluation metrics, and several strong models. Although high, the best scores (81% GENIE, 61.4% F1, 63.2% ROUGE-L) still leave considerable room for improvement. In addition, the dataset provides a natural setting for new research on explanation, as many questions require reasoning to construct answers. We hope the dataset spurs further advances in complex question-answering by the community. ARC-DA is available at https://allenai.org/data/arc-da
研究动机与目标
- 为解决多项选择问答数据集不自然且易导致捷径学习的问题,创建ARC数据集的直接回答(自由格式)版本。
- 提供一个高质量、经专家构建的自然科学问题数据集,要求推理能力,避免众包数据集中常见的重复和偏差。
- 支持复杂、开放式问答研究,答案不限于文本片段,以支持推理与解释。
- 建立一个反映现实世界问答场景的基准,同时保留原始ARC数据集的推理复杂性。
- 评估最先进模型在直接回答问答任务上的表现,并评估自动化指标与人工评估之间的可靠性。
提出的方法
- 采用混合方法(众包与专家评审结合),将ARC数据集中的2,985道多项选择题转化为直接回答格式,确保答案的有效性与多样性。
- 为每道问题收集多个有效答案(共8,436个),以反映自然语言表达的差异,并支持稳健评估。
- 通过GENIE——一种自动化众包评分流水线——进行人工评估,以获得可靠的人工判断,并辅以专家评分进行校准。
- 使用F1和ROUGE-L等自动化指标评估模型输出,同时承认其与人工判断相比的局限性。
- 在ARC-DA数据集上微调强基线T5模型(如UnifiedQA),并使用自动化指标与人工标注分数进行评估。
- 通过将相同模型应用于原始ARC多项选择数据集,开展消融研究,揭示跨格式性能提升。
实验结果
研究问题
- RQ1尽管缺乏答案选项,直接回答问答模型是否能在高质量、高推理强度的数据集ARC-DA上实现高性能?
- RQ2自动化评估指标(F1、ROUGE-L)与人工标注分数相比,在评估直接回答问答性能时表现如何?
- RQ3在直接回答数据上进行训练,能在多大程度上提升多项选择问答性能?反之亦然?
- RQ4在开放式、推理型问答中,模型表现与人工标注的黄金标准之间存在多大差距?
- RQ5ARC-DA中有效答案的多样性在多大程度上影响模型泛化能力与评估可靠性?
主要发现
- 最佳模型在GENIE人工评估中得分为81%,表明表现强劲但尚未完美,仍有显著提升空间。
- 最佳模型在F1上得分为61.4%,在ROUGE-L上得分为63.2%,表明自动化指标与人工判断之间存在明显差距。
- 人工标注分数(GENIE与EXPERT)高于自动化指标,表明当前自动化指标低估了模型表现,并可能遗漏有效答案的表达变体。
- GENIE评分略低于专家标注评分,表明人工评估更可靠,GENIE流水线可能存在噪声或标注错误。
- 在ARC-DA上进行训练可提升模型在原始ARC多项选择数据集上的表现,UnifiedQA模型在ARC-Challenge上达到81.4%,在ARC-Easy上达到92.7%,表明存在跨格式学习优势。
- 结果证实,直接回答问答是推理型问答的一种可行且更自然的设置,ARC-DA为未来NLP研究提供了有意义的挑战。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。