Skip to main content
QUICK REVIEW

[论文解读] Maieutic Prompting: Logically Consistent Reasoning with Recursive Explanations

Jaehun Jung, Lianhui Qin|arXiv (Cornell University)|May 24, 2022
Topic Modeling被引用 7
一句话总结

Maieutic prompting 是一种新颖的少样本推理方法,通过递归生成对两种可能答案(True/False)的溯因解释,构建相互关联命题的树状结构,并利用加权 MAX-SAT 解决矛盾,从而推断出最一致的真值赋值,显著提升大语言模型的逻辑一致性。该方法在常识推理基准测试中,准确率最高比当前最先进提示方法高出 20%,即使解释存在噪声或不一致时仍表现优异。

ABSTRACT

Despite their impressive capabilities, large pre-trained language models (LMs) struggle with consistent reasoning; recently, prompting LMs to generate explanations that self-guide the inference has emerged as a promising direction to amend this. However, these approaches are fundamentally bounded by the correctness of explanations, which themselves are often noisy and inconsistent. In this work, we develop Maieutic Prompting, which infers a correct answer to a question even from the noisy and inconsistent generations of LM. Maieutic Prompting induces a tree of explanations abductively (e.g. X is true, because ...) and recursively, then frames the inference as a satisfiability problem over these explanations and their logical relations. We test Maieutic Prompting for true/false QA on three challenging benchmarks that require complex commonsense reasoning. Maieutic Prompting achieves up to 20% better accuracy than state-of-the-art prompting methods, and as a fully unsupervised approach, performs competitively with supervised models. We also show that Maieutic Prompting improves robustness in inference while providing interpretable rationales.

研究动机与目标

  • 解决基于解释的提示方法的根本局限,即模型生成的解释往往存在逻辑不一致或事实不可靠的问题。
  • 使大语言模型即使在自身解释存在噪声或矛盾的情况下,也能推断出正确答案。
  • 开发一种完全无监督的方法,利用模型内在自生成的推理过程,提升推理的鲁棒性与可解释性。
  • 以符号化方式建模解释之间的逻辑关系,使用 MAX-SAT 解决不一致问题,识别最连贯的推理结果。
  • 在复杂的常识推理与事实验证任务中,超越少样本提示基线方法与监督模型的性能。

提出的方法

  • 促使语言模型为给定问题的 True 和 False 两种假设分别生成溯因解释,而非仅生成单一解释。
  • 递归提示模型验证自身解释,构建具有逻辑依赖关系的树状命题层级结构。
  • 将每个解释和原始问题视为命题变量,其置信度分数代表信念强度。
  • 将命题之间的逻辑关系(如蕴含、矛盾)建模为加权 MAX-SAT 公式中的权重子句。
  • 使用加权 MAX-SAT 求解器寻找能最大化满足子句数量的真值赋值,确保逻辑一致性。
  • 以完全无监督的方式应用该方法,仅需少量样本提示,无需微调或人工标注的推理过程。

实验结果

研究问题

  • RQ1能否利用语言模型自身生成的不一致或错误解释,推断出逻辑一致且正确的答案?
  • RQ2在树状结构的自生成解释上进行符号化推理,能在多大程度上提升推理准确率,超越标准基于解释的提示方法?
  • RQ3与基线方法相比,Maieutic prompting 在输入问题和提示存在扰动时,其鲁棒性如何?
  • RQ4完全无监督的方法能否在复杂常识推理任务中实现与监督模型相媲美甚至更优的性能?
  • RQ5Maieutic prompting 生成的模型推理过程,在质量与连贯性方面,与人工标注的推理过程相比如何?

主要发现

  • Maieutic prompting 在三个具有挑战性的常识推理与事实验证基准测试中,准确率最高比当前最先进少样本提示方法高出 20%。
  • 该方法在无需任何微调或人工标注推理过程的情况下,性能与监督模型相当。
  • 42% 的错误答案对应解释在事实上是正确的,23% 的解释能完全帮助识别正确答案,表明即使存在错误,只要合理处理,解释仍具价值。
  • 该方法在问题与提示存在扰动时表现出更强的鲁棒性,在对抗性与噪声条件下优于基线方法。
  • 生成的推理过程具有可解释性且具有说服力,常形成连贯的逻辑链条,其质量可与或超越真实标注的解释。
  • 利用 MAX-SAT 解决解释树中矛盾,相比仅依赖单个解释置信度分数,能实现更一致、更可靠的推理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。