[论文解读] Boosting Language Models Reasoning with Chain-of-Knowledge Prompting
本文提出了链式知识(Chain-of-Knowledge, CoK)提示方法,通过在文本解释之外显式提取结构化的知识三元组(证据性事实),增强大语言模型的推理能力。通过整合外部知识库并应用F²-验证策略,评估事实性与忠实度,CoK提升了在常识性、事实性、符号性及算术推理任务中的推理可靠性与性能表现,优于标准 few-shot 学习与思维链(chain-of-thought)提示方法。
Recently, Chain-of-Thought (CoT) prompting has delivered success on complex reasoning tasks, which aims at designing a simple prompt like ``Let's think step by step'' or multiple in-context exemplars with well-designed rationales to elicit Large Language Models (LLMs) to generate intermediate reasoning steps. However, the generated rationales often come with mistakes, making unfactual and unfaithful reasoning chains. To mitigate this brittleness, we propose a novel Chain-of-Knowledge (CoK) prompting, where we aim at eliciting LLMs to generate explicit pieces of knowledge evidence in the form of structure triple. This is inspired by our human behaviors, i.e., we can draw a mind map or knowledge map as the reasoning evidence in the brain before answering a complex question. Benefiting from CoK, we additionally introduce a F^2-Verification method to estimate the reliability of the reasoning chains in terms of factuality and faithfulness. For the unreliable response, the wrong evidence can be indicated to prompt the LLM to rethink. Extensive experiments demonstrate that our method can further improve the performance of commonsense, factual, symbolic, and arithmetic reasoning tasks.
研究动机与目标
- 为解决思维链(CoT)提示方法的脆弱性问题,即大语言模型生成不真实或不忠实的推理链。
- 通过显式提取结构化知识证据(以知识三元组形式),提升大语言模型推理的可靠性。
- 开发一种F²-验证方法,用于评估推理链的事实性(与真实知识的一致性)与忠实度(与文本解释及最终答案的一致性)。
- 实现一种重思机制,通过突出错误证据,识别并修正不可靠的推理过程。
- 在涵盖常识性、事实性、符号性及算术推理任务的多样化推理基准上,验证CoK提示方法的有效性。
提出的方法
- CoK提示结合两种组件:证据三元组(CoK-ET),即以(主体,关系,客体)形式存在的结构化知识事实;以及解释提示(CoK-EH),提供推理链的文本依据。
- 通过采样带标签的示例,并附加“让我们一步步思考”提示以激发推理,随后从外部知识库中检索并人工标注相关知识三元组,构建上下文示例。
- F²-验证策略量化两种可靠性指标:事实性(推理证据与真实知识的一致性)与忠实度(证据与文本解释及最终答案的一致性)。
- 对于不可靠输出,F²-验证识别出错误证据,触发大语言模型的重思过程,以修正其推理。
- 该方法在零样本少样本设置下应用,无需微调,通过基于CoK结构的上下文示范来引导大语言模型。
- 重思过程利用识别出的错误证据,引导大语言模型生成修正后的推理链,从而提升最终答案的准确率。

实验结果
研究问题
- RQ1与标准思维链提示相比,结构化知识三元组是否能提升大语言模型推理的事实性与忠实度?
- RQ2F²-验证策略在基于证据质量检测不可靠推理链方面是否有效?
- RQ3CoK提示是否在常识性、事实性、符号性及算术推理等多样化推理任务中带来可测量的性能提升?
- RQ4由F²-验证引导的重思机制是否能有效纠正错误推理并提升答案准确率?
- RQ5在不更新参数的前提下,CoK提示在多大程度上减少了大语言模型的幻觉或不一致推理?
主要发现
- CoK提示在常识性推理任务中显著提升性能,优于标准上下文学习与思维链提示方法。
- 在事实性推理基准上,CoK通过显式整合知识三元组,有效降低不真实推理链的比例,实现更高的准确率。
- F²-验证方法成功识别出不可靠的推理链,重点检测出事实性错误的证据与不一致的解释。
- 由F²-验证引导的重思过程通过修正错误推理路径,显著提升了最终答案的准确率。
- 在算术与符号性推理任务中,CoK展现出更优的鲁棒性与可靠性,尤其在保持证据与结论之间逻辑一致性方面表现突出。
- 实证结果表明,该方法在多个数据集(包括StrategyQA)上均实现一致的性能增益,证明其在不同推理类型中的泛化能力。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。