[论文解读] Evaluating Step-by-Step Reasoning through Symbolic Verification
该论文提出了语言模型作为逻辑程序员(LMLP),一种神经符号框架,利用符号一阶逻辑规则和知识库(KB)实现关系推理的 few-shot 上下文学习。尽管使用更小的模型,LMLP 在长度泛化基准上的表现仍优于思维链(CoT)提示方法超过 25%,证明了符号表示能提升组合泛化能力和推理可靠性。
Pre-trained language models (LMs) have shown remarkable reasoning performance using explanations or chain-of-thoughts (CoT)) for in-context learning. On the other hand, these reasoning tasks are usually presumed to be more approachable for symbolic programming. To understand the mechanism of reasoning of LMs, we curate synthetic datasets containing equivalent (natural, symbolic) data pairs, where symbolic examples contain first-order logic rules and predicates from non-parametric knowledge bases (KBs), supporting automated verification of intermediate reasoning results. Then we revisit neuro-symbolic approaches and propose to learn from demonstrations containing logic rules and corresponding examples to iteratively reason over KBs, recovering Prolog's backward chaining algorithm and supporting automated verification of LMs' outputs. Comprehensive experiments are included to systematically compare LMLP with CoT in deductive reasoning settings, showing that LMLP enjoys more than $25\%$ higher accuracy than CoT on length generalization benchmarks even with smaller model sizes.
研究动机与目标
- 探究符号表示是否能提升关系推理任务中上下文学习的效果。
- 解决 few-shot 推理中的组合性挑战,即模型在面对信息的新组合时表现失败的问题。
- 比较自然语言解释(CoT)与符号逻辑规则在 few-shot 提示中的有效性。
- 评估语言模型是否能通过符号演示有效在知识库上进行推理。
- 探索符号提示是否能实现比自然语言提示更可靠、更可扩展的推理。
提出的方法
- 该方法使用配对的合成数据集,包含自然语言和符号(一阶逻辑)示例,以实现受控比较。
- LMLP 使用逻辑规则模板和知识库(KB)谓词来引导推理,将每个生成步骤限制在有效的 KB 关系范围内。
- 在每个推理步骤中,掩码翻译模型将自然语言生成映射为 KB 中的(主体,关系,客体)三元组,确保语义的根基性。
- 模型迭代地在 KB 上应用后向链式推理,使用检索到的逻辑规则和示例作为上下文中的示范。
- 采用 GPT-2 和 Sentence-BERT 作为主干网络,其参数量小于典型的 CoT 模型,以测试在低资源符号提示下的性能表现。
- 推理路径由人工评估,成功定义为通过有效 KB 步骤正确推导出目标关系。
实验结果
研究问题
- RQ1与自然语言解释相比,使用一阶逻辑规则进行符号提示是否能提升 few-shot 推理中的组合泛化能力?
- RQ2语言模型是否能有效通过符号示范学习在知识库上推理,而无需在 KB 上进行大规模预训练?
- RQ3在长度泛化基准上,符号提示(LMLP)与思维链(CoT)的性能相比如何?
- RQ4当测试序列长度超过训练序列时,符号表示在多大程度上能减少灾难性性能下降?
- RQ5符号提示是否能实现比自然语言提示更可靠、更具可解释性的推理路径?
主要发现
- 即使使用更小的模型(如 GPT-2),LMLP 在长度泛化基准上的准确率也比 CoT 高出 25% 以上。
- LMLP 展现出更优的组合泛化能力,在推理长度超过训练序列时仍保持高性能。
- CoT 提示在更长序列上表现出灾难性性能下降,尽管在短序列上表现良好,但无法实现组合泛化。
- 使用符号示范可实现更可靠、更具可解释性的推理路径,因为每一步都基于 KB 谓词进行根基化。
- LMLP 在更小模型和非 KB 预训练主干网络上也表现有效,表明符号提示可弥补模型规模的不足。
- 结果表明,符号表示明确分离了逻辑与控制,相比基于自然语言的 CoT,能实现更稳定、更具可扩展性的推理。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。