[论文解读] Neuro-Symbolic Integration Brings Causal and Reliable Reasoning Proofs
该论文提出 CaRing,一种神经符号框架,结合大型语言模型(LLM)进行知识抽取与无需 LLM 的符号求解器进行 deliberative 推理,确保因果性和可靠的推理证明。通过使用定制的元解释器执行形式化知识,CaRing 在 ProofWriter 上实现了接近完美的准确率(7B 模型为 98.80%,34B 模型为 100%),推理证明相似度超过 CoT 基线三倍以上,且在 GSM8K 和 PrOntoQA 上均有显著提升。
Two lines of approaches are adopted for complex reasoning with LLMs. One line of work prompts LLMs with various reasoning structures, while the structural outputs can be naturally regarded as intermediate reasoning steps. Another line of work adopt LLM-free declarative solvers to do the reasoning task, rendering higher reasoning accuracy but lacking interpretability due to the black-box nature of the solvers. Aiming to resolve the trade-off between answer accuracy and interpretability, we present a simple extension to the latter line of work. Specifically, we showcase that the intermediate search logs generated by Prolog interpreters can be accessed and interpreted into human-readable reasoning proofs. As long as LLMs correctly translate problem descriptions into Prolog representations, the corresponding reasoning proofs are ensured to be causal and reliable. On two logical reasoning and one arithmetic reasoning datasets, our framework obtains significant improvements in terms of both answer accuracy and reasoning proof accuracy. Our code is released at https://github.com/DAMO-NLP-SG/CaRing
研究动机与目标
- 为解决大型语言模型(LLM)生成的推理证明中缺乏因果性和可靠性的问题,这些模型常因错误或幻觉化的中间步骤而得出正确答案。
- 开发一种神经符号框架,将知识表示(通过 LLM)与 deliberative 推理(通过符号求解器)分离,确保推理过程的确定性和可追溯性。
- 生成在结构和因果关系上与标准答案一致的推理证明,尤其在复杂、多前提的推理任务中表现突出。
- 在多种推理数据集上评估该方法,包括逻辑推理(ProofWriter、PrOntoQA)和自然语言算术推理(GSM8K),以评估其泛化能力和鲁棒性。
提出的方法
- 采用两阶段神经符号框架:首先,基于 LLM 的符号表示生成器(SymGen)将自然语言问题转化为形式化、机器可读的知识表示。
- 其次,符号推理引擎(SymInfer)使用定制的元解释器在形式化知识上执行 deliberative 推理,支持可追溯的执行和灵活的搜索策略。
- 符号求解器在推理过程中与 LLM 完全隔离,防止幻觉产生,并确保推理步骤的确定性和因果性。
- 通过实现元解释器来追踪推理路径,实现完全可追溯性,并支持多种搜索策略,如深度优先或最佳优先搜索。
- 推理证明以有向无环图(DAG)形式表示,相似度通过预测推理图与标准推理图之间的归一化图编辑距离进行度量。
- 该方法在多个 LLM 尺寸(7B、13B、34B)和数据集上进行了评估,通过优化的 LLM 服务(如 vLLM)将推理成本保持在最低水平。
实验结果
研究问题
- RQ1神经符号方法是否能显著提升 LLM 生成的推理证明的可靠性和因果性,尤其是在中间步骤错误但答案正确的情况下?
- RQ2在将自然语言问题转化为形式逻辑后,无需 LLM 的符号求解器在保持推理可追溯性和结构保真度方面有多高效?
- RQ3混合神经符号系统在不同语言复杂度的数据集上(如合成逻辑推理,ProofWriter;真实世界算术推理,GSM8K)的泛化能力如何?
- RQ4将知识表示与推理执行解耦,是否能带来可测量的提升,体现在答案准确率和推理证明相似度方面,相较于端到端的 LLM 提示?
主要发现
- 在 ProofWriter 上,CaRing 使用 7B 模型实现了 98.80% 的准确率和 83.17% 的推理证明相似度,准确率几乎是 CoT 基线的两倍(52.00%),推理证明相似度更是超过三倍(24.12%)。
- 在 PrOntoQA 上,CaRing 使用 34B 模型达到 100% 的准确率,表明其在具有简化自然语言逻辑陈述的数据集上表现强劲。
- 在 GSM8K 上,CaRing 使用 34B 模型实现了 42.22% 的准确率和 22.91% 的推理证明相似度,推理证明相似度接近最强 CoT 基线(13.04%)的两倍。
- 该方法在所有模型尺寸上均保持高性能,准确率随模型从 7B 到 34B 而提升,表明其具备可扩展性和鲁棒性。
- 尽管自然语言存在固有模糊性,CaRing 仍能有效泛化到 GSM8K,表明 LLM 的泛化能力与符号推理在真实场景中具有良好的互补性。
- 由于采用了优化的 LLM 服务,推理成本保持较低水平,尽管推理路径最长,输出长度仅略有增加。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。