[论文解读] NELLIE: A Neuro-Symbolic Inference Engine for Grounded, Compositional, and Explainable Reasoning
Nellie 是一种神经符号推理引擎,通过利用大语言模型生成规则并结合检索增强推理,从自然语言语料库中构建逻辑证明树,实现端到端、基于事实且可解释的问题回答。它在 EntailmentBank 上比最先进的基线模型 Entailer-3B 提高 22%,在 WorldTree 上提高 26%,同时确保了逻辑方向性和基于人类提供文本的事实性依据。
Our goal is a modern approach to answering questions via systematic reasoning where answers are supported by human interpretable proof trees grounded in an NL corpus of authoritative facts. Such a system would help alleviate the challenges of interpretability and hallucination with modern LMs, and the lack of grounding of current explanation methods (e.g., Chain-of-Thought). This paper proposes a new take on Prolog-based inference engines, where we replace handcrafted rules with a combination of neural language modeling, guided generation, and semiparametric dense retrieval. Our implementation, NELLIE, is the first system to demonstrate fully interpretable, end-to-end grounded QA as entailment tree proof search, going beyond earlier work explaining known-to-be-true facts from text. In experiments, NELLIE outperforms a similar-sized state-of-the-art reasoner [Tafjord et al., 2022] while producing knowledge-grounded explanations. We also find NELLIE can exploit both semi-structured and NL text corpora to guide reasoning. Together these suggest a new way to jointly reap the benefits of both modern neural methods and traditional symbolic reasoning.
研究动机与目标
- 为解决现代基于大语言模型的问答系统在医疗、法律等高风险领域中可解释性与事实性依据不足的问题。
- 克服依赖手工编写符号规则的经典专家系统在鲁棒性与可扩展性方面的缺陷。
- 实现端到端、逻辑导向的推理,使答案由基于权威自然语言语料库的人类可理解的证明树支持。
- 联合利用大语言模型的推理能力与符号推理的可验证性,无需人工规则工程。
- 证明神经符号系统可在保持完全可解释性与事实性依据的同时,实现具有竞争力的问答性能。
提出的方法
- Nellie 以基于后向链式推理的 Prolog 符号定理证明器为核心推理引擎,使用神经谓词替代手工规则。
- 通过大语言模型动态生成候选推理规则,条件基于检索到的事实和预定义的推理模板。
- 系统采用检索增强生成(RAG)技术,使规则生成基于语料库中相关事实,提升相关性与准确性。
- 利用自然语言蕴涵(NLI)模型在自由形式自然语言中执行假设与事实之间的弱统一,实现蕴涵检查。
- 证明搜索过程递归地将查询分解为子查询,通过蕴涵检查或进一步分解来证明每个子查询,从而构建组合性蕴涵树。
- 使用两个条件生成模块——模板条件生成(TCG)和检索条件生成(RCG)——引导规则生成,消融研究显示二者具有关键作用。
实验结果
研究问题
- RQ1神经符号系统是否能在不依赖手工符号规则的前提下,同时实现高性能问答与对事实性文本的完全基于?
- RQ2大语言模型在多大程度上可被用于动态生成推理规则,以在符号框架中支持系统性、组合性推理?
- RQ3检索增强与模板条件生成如何提升基于事实推理中证明树构建的质量与准确性?
- RQ4该系统是否可通过简单扩展知识语料库实现跨领域泛化,而无需微调或重写规则?
- RQ5当多跳推理中出现幻觉或语义漂移时,基于事实的可解释推理的主要失败模式是什么?
主要发现
- 在默认配置下,尽管要求提供基于事实的证明,Nellie 在 EntailmentBank 上仍比相同规模的 Entailer-3B 基线模型高出 22%,在 WorldTree 上高出 26%。
- 即使在性能超越一个参数量达 11B 的 Entailer 模型(该模型不需基于事实的解释)的情况下,Nellie 仍实现了具有竞争力的性能。
- 消融研究显示,若同时移除检索条件生成(RCG)与模板条件生成(TCG),性能下降 1–1.5 分;若仅移除 RCG,则性能下降 3–4 分,证明二者在实证上的必要性。
- 当引入 OpenBookQA 中的常识知识后,Nellie 的问答准确率提升 11–12%,正确证明构建率提升 9–12%,表明其具备领域泛化能力。
- 主要错误类型为未能为正确答案找到有效证明,其次是超类属性继承错误与推理链中跨步的语义漂移。
- 错误分析显示,错误证明常源于 NLI 基于的蕴涵检查中出现的假阳性,这是由于推理步骤间语义漂移所致,凸显了未来优化的关键挑战。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。