Skip to main content
QUICK REVIEW

[论文解读] Contrastive Chain-of-Thought Prompting

Yew Ken Chia, Guizhen Chen|arXiv (Cornell University)|Nov 15, 2023
Topic Modeling被引用 5
一句话总结

本文提出对比链式思维(CoT)提示方法,通过提供有效和无效的推理示范,增强大语言模型的推理能力。通过从现有正确推理链中自动生成对比性推理过程,该方法提升了推理准确率并减少了错误,在使用 GPT-3.5-Turbo 时,于 GSM-8K 和 Bamboogle Press 基准测试中分别实现了 9.8 和 16.0 的绝对性能提升。

ABSTRACT

Despite the success of chain of thought in enhancing language model reasoning, the underlying process remains less well understood. Although logically sound reasoning appears inherently crucial for chain of thought, prior studies surprisingly reveal minimal impact when using invalid demonstrations instead. Furthermore, the conventional chain of thought does not inform language models on what mistakes to avoid, which potentially leads to more errors. Hence, inspired by how humans can learn from both positive and negative examples, we propose contrastive chain of thought to enhance language model reasoning. Compared to the conventional chain of thought, our approach provides both valid and invalid reasoning demonstrations, to guide the model to reason step-by-step while reducing reasoning mistakes. To improve generalization, we introduce an automatic method to construct contrastive demonstrations. Our experiments on reasoning benchmarks demonstrate that contrastive chain of thought can serve as a general enhancement of chain-of-thought prompting.

研究动机与目标

  • 探究无效推理示范是否能够提升语言模型的推理性能,挑战‘仅有效链路有益’的假设。
  • 解决对链式思维提示机制工作原理理解不足的问题,尤其考虑到无效示范与有效示范常表现出相似性能。
  • 通过明确教导模型‘不应如何做’来减少推理错误,提升模型的鲁棒性和可信度。
  • 开发一种无需额外标注成本的自动方法,用于生成对比性示范,实现跨任务的泛化能力。
  • 将对比 CoT 定位为一种通用的常规链式思维提示增强方法,兼容现有的解码策略(如自一致性)。

提出的方法

  • 该方法引入对比链式思维提示,即在少样本提示上下文中同时提供正确和错误的推理示范。
  • 通过引入逻辑或事实性不一致(如错误的算术或有缺陷的推理步骤)对现有有效推理链进行扰动,自动生成无效推理链。
  • 扰动策略旨在保持任务相关性的同时引入看似合理但错误的推理路径,使模型能够从反例中学习。
  • 该方法与任务无关,且兼容现有的 CoT 解码策略(如自一致性),后者可进一步放大性能增益。
  • 该方法利用模型区分正确与错误推理路径的能力,类似于对比学习,以提升推理泛化能力。
  • 对比示范的构建无需新标注,完全基于现有正确推理链生成,从而将成本降至最低。
Figure 1: Example of contrastive chain-of-thought which leverages both positive and negative demonstrations to enhance language model reasoning.
Figure 1: Example of contrastive chain-of-thought which leverages both positive and negative demonstrations to enhance language model reasoning.

实验结果

研究问题

  • RQ1尽管先前研究发现无效链路影响甚微,但无效推理示范是否仍能提升语言模型的推理性能?
  • RQ2在对比提示中,哪些类型的推理错误作为负样本最为有效?
  • RQ3能否在无需人工标注的情况下,从现有正确推理链中自动生成对比示范?
  • RQ4对比 CoT 是否能在多种推理任务中泛化,并提升对常见推理错误的鲁棒性?
  • RQ5对比 CoT 与现有解码策略(如自一致性)如何相互作用?是否能放大其优势?

主要发现

  • 在使用 GPT-3.5-Turbo 时,对比 CoT 在 GSM-8K 基准测试中实现了 9.8 个百分点的绝对性能提升,在 Bamboogle Press 基准测试中实现了 16.0 个百分点的提升。
  • 通过对手动分析模型输出的验证,该方法显著减少了生成推理链中的推理错误数量。
  • 当与自一致性结合使用时,对比 CoT 在 AQuA 数据集上实现了额外 14.2% 的性能增益,表明存在协同增益效应。
  • 对比示范的自动生成方式与传统 CoT 保持相同的标注成本,因此具备可扩展性和实用性。
  • 该方法在多个推理基准测试中均优于传统 CoT,证实其作为通用增强手段的有效性。
  • 结果表明,从正负样本中同时学习对于提升推理鲁棒性和模型可信度至关重要。
Figure 2: Categorization of invalid chain-of-thought examples, following Wang et al. ( 2023 ) .
Figure 2: Categorization of invalid chain-of-thought examples, following Wang et al. ( 2023 ) .

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。