[论文解读] STREET: A Multi-Task Structured Reasoning and Explanation Benchmark
本文提出了 STREET,一个用于自然语言问答中结构化推理与解释的多任务、多领域基准。它要求模型生成逐步推理图——连接前提与结论的文本蕴涵结构链——揭示即使表现强劲的模型如微调后的 T5 和 few-shot GPT-3 在连贯且准确的推理方面仍存在显著困难,凸显了当前语言模型在可解释推理能力方面的重大差距。
We introduce STREET, a unified multi-task and multi-domain natural language reasoning and explanation benchmark. Unlike most existing question-answering (QA) datasets, we expect models to not only answer questions, but also produce step-by-step structured explanations describing how premises in the question are used to produce intermediate conclusions that can prove the correctness of a certain answer. We perform extensive evaluation with popular language models such as few-shot prompting GPT-3 and fine-tuned T5. We find that these models still lag behind human performance when producing such structured reasoning steps. We believe this work will provide a way for the community to better train and test systems on multi-step reasoning and explanations in natural language.
研究动机与目标
- 为解决缺乏全面评估自然语言问答中推理与可解释性的基准这一问题。
- 开发一个统一的多步、多领域推理框架,以捕捉定量推理、分析推理和演绎推理等多种推理类型。
- 通过要求生成结构化、逐步的解释(即推理图),追踪前提如何导向结论,从而提升模型的可解释性。
- 评估最先进语言模型在生成连贯且准确的推理链方面的能力,超越简单的答案预测。
- 提供一个标准化的多任务基准,实现对不同领域和推理复杂度层级下推理能力的系统性评估。
提出的方法
- 该基准引入文本逻辑单元(TLUs)作为从上下文、问题和答案选项中提取的原子推理组件。
- 每个问题均关联一个由多个中间推理步骤组成的推理图,每个步骤均为源自 TLUs 的文本蕴涵。
- 推理图由专家标注(14.7k 个步骤)或程序化生成,总计包含 151.1k 个推理步骤,覆盖 35.8k 个问题。
- 数据集涵盖三个领域:定量推理(如 GSM8K)、分析推理(如 AR-LSAT)和演绎/常识推理。
- 评估指标旨在验证生成的推理图与标准答案图在结构和语义上的一致性,包括步骤正确性和逻辑连贯性。
- 通过 few-shot 提示(GPT-3)和微调(T5)在完整基准上对模型进行评估,性能通过答案准确率和推理图保真度进行衡量。
实验结果
研究问题
- RQ1语言模型能否生成结构化、多步骤的推理图,准确解释答案如何从前提中推导而出?
- RQ2当前大型语言模型(如 GPT-3 和微调后的 T5)在生成跨多种推理类型的连贯且逻辑有效的推理链方面表现如何?
- RQ3即使最终答案正确,模型在多大程度上会幻觉化答案或产生错误的推理步骤?
- RQ4推理的复杂度(如步骤数量、结构深度)如何影响模型生成准确解释的能力?
- RQ5推理生成中的主要失败模式是什么,例如逻辑错误、计算错误或无关步骤的插入?
主要发现
- 微调后的 T5 和 few-shot GPT-3 在底层问答任务中实现了高答案准确率,但在生成正确推理图方面表现显著不足,表明答案预测与推理解释之间存在脱节。
- 约 28% 的 GPT-3 推理步骤在无逻辑依据的情况下幻觉化了答案,即使最终答案正确。
- 在 GSM8K 中,约 12% 的错误推理步骤源于计算错误,凸显了持续存在的数值推理局限性。
- 在 AR-LSAT 任务中,GPT-3 [davinci] 常常无法生成任何答案,约 33% 的输出不包含回答,且频繁复制 TLUs 而未得出结论。
- 模型在复杂、多前提推理场景中表现出强烈的生成不连贯或无关推理步骤的倾向,表明其推理泛化能力仍不充分。
- 人类在推理图生成任务上的表现显著优于模型,证实当前语言模型在结构化、可解释推理方面仍存在明显差距。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。