[论文解读] AR-LSAT: Investigating Analytical Reasoning of Text
本文提出了 AR-LSAT,一个从 1991–2016 年 LSAT 分析性推理题中衍生的新数据集,并提出了一种称为分析性推理机器(ARM)的逻辑层级推理框架,该框架可提取符号知识并应用可解释的逻辑推理。ARM 在性能上优于基于 Transformer 的模型,后者因推理能力受限于表面语义而表现不佳,凸显了在复杂分析任务中采用符号推理的必要性。
Analytical reasoning is an essential and challenging task that requires a system to analyze a scenario involving a set of particular circumstances and perform reasoning over it to make conclusions. In this paper, we study the challenge of analytical reasoning of text and introduce a new dataset consisting of questions from the Law School Admission Test from 1991 to 2016. We analyze what knowledge understanding and reasoning abilities are required to do well on this task. Furthermore, to address this reasoning challenge, we design two different baselines: (1) a Transformer-based method which leverages the state-of-the-art pre-trained language models and (2) Analytical Reasoning Machine (ARM), a logical-level reasoning framework extracting symbolic knowledge (e.g, participants, facts, logical functions) to deduce legitimate solutions. In our experiments, we find that the Transformer-based models struggle to solve this task as their performance is close to random guess and ARM achieves better performance by leveraging symbolic knowledge and interpretable reasoning steps. Results show that both methods still lag far behind human performance, which leave further space for future research.
研究动机与目标
- 研究自然语言文本中分析性推理的挑战。
- 为评估推理模型在复杂逻辑推理任务上的表现,开发一个基准数据集。
- 设计并评估两种不同的方法——神经方法与符号方法——以解决分析性推理问题。
- 识别当前预训练模型的关键局限性,并为未来可解释的符号推理研究提出方向。
提出的方法
- 提出 AR-LSAT,一个包含 1991–2016 年 LSAT 分析性推理题的数据集,用于基准化推理模型。
- 设计基于 Transformer 的基线模型,使用预训练语言模型(如 BERT、RoBERTa)编码上下文并分类答案选项。
- 开发分析性推理机器(ARM),一种符号框架,用于从文本中提取参与者、事实和规则。
- 通过符号解析将自然语言规则映射为可执行的逻辑函数(例如,'若 A 在 X 上,则 B 在 Y 上')。
- 通过检查候选解与所有约束的一致性,执行逻辑推理。
- 使用评分机制将选项与有效分配匹配,实现可解释的预测。
实验结果
研究问题
- RQ1像 BERT 和 RoBERTa 这类预训练神经模型能否解决需要深度逻辑推理的复杂分析性推理任务?
- RQ2解决分析性推理问题所必需的符号知识组件(参与者、事实、规则)有哪些?
- RQ3像 ARM 这类符号推理系统与神经基线相比,在性能和可解释性方面表现如何?
- RQ4当前模型在理解与推理自然语言约束时的主要失败模式是什么?
主要发现
- 基于 Transformer 的模型仅达到接近随机的性能(准确率接近 20%),表明其在超越表面语义的深度推理方面存在严重局限。
- ARM 在开发集上达到 34.2% 的准确率,在测试集上达到 30.9%,显著优于神经基线模型。
- 人类表现远高于两种模型,表明未来研究仍存在巨大差距。
- ARM 的主要错误类型包括规则解析不完整(例如,遗漏“至少”语义)、参与者/位置提取错误,以及缺乏常识知识。
- 研究识别出符号解析和逻辑推理是关键瓶颈,尤其在处理复杂或隐含语义规则时。
- 结果表明,将神经网络与符号系统相结合,可能是推动 NLP 中分析性推理发展的关键。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。