[论文解读] Causal Prompting: Debiasing Large Language Model Prompting based on Front-Door Adjustment
该论文提出了一种名为因果提示(Causal Prompting)的新颖提示方法,利用因果推断中的前门调整(front-door adjustment)来在不访问模型参数或logits的情况下消除大语言模型(LLMs)的偏见。通过将思维链(chain-of-thought, CoT)推理视为中介变量,该方法利用聚类和归一化加权几何平均(normalized weighted geometric mean, NWGM)近似,估计输入提示与输出之间的因果效应,在开源和闭源大语言模型的自然和对抗性NLP数据集上均实现了最先进(state-of-the-art)的鲁棒性表现。
Despite the notable advancements of existing prompting methods, such as In-Context Learning and Chain-of-Thought for Large Language Models (LLMs), they still face challenges related to various biases. Traditional debiasing methods primarily focus on the model training stage, including approaches based on data augmentation and reweighting, yet they struggle with the complex biases inherent in LLMs. To address such limitations, the causal relationship behind the prompting methods is uncovered using a structural causal model, and a novel causal prompting method based on front-door adjustment is proposed to effectively mitigate LLMs biases. In specific, causal intervention is achieved by designing the prompts without accessing the parameters and logits of LLMs. The chain-of-thought generated by LLM is employed as the mediator variable and the causal effect between input prompts and output answers is calculated through front-door adjustment to mitigate model biases. Moreover, to accurately represent the chain-of-thoughts and estimate the causal effects, contrastive learning is used to fine-tune the encoder of chain-of-thought by aligning its space with that of the LLM. Experimental results show that the proposed causal prompting approach achieves excellent performance across seven natural language processing datasets on both open-source and closed-source LLMs.
研究动机与目标
- 为解决大语言模型(LLMs)在上下文学习和思维链提示中持续存在的偏见问题,特别是在对抗性扰动下的表现,提出改进方案。
- 克服传统去偏方法(如模型微调或数据重加权)的局限性,这些方法在基于提示的推理中不可行。
- 开发一种完全在推理阶段运行的去偏方法,无需访问模型参数、logits或混杂变量值。
- 通过将思维链(CoT)作为中介变量,利用结构因果模型实现有效的因果干预。
- 通过因果干预提升模型在分布内和分布外(对抗性)数据上的泛化能力。
提出的方法
- 该方法将提示过程建模为结构因果模型,其中输入提示(X)通过思维链推理(R)影响输出(A),而未观测到的混杂因子(U)引入偏见。
- 应用前门调整来估计X对A的总因果效应,通过分解为X对R的影响和R对A的影响,避免直接建模混杂因子。
- 利用基于BERT的编码器结合对比学习,对思维链响应(P(R|X))的概率进行估计,以对齐编码器与大语言模型之间的表示空间。
- 对思维链响应应用聚类算法,以识别具有代表性的推理路径,从而在不访问logits的情况下准确估计P(R|do(X))。
- 利用归一化加权几何平均(NWGM)近似方法估计从R到A的因果效应,以选择最能代表数据分布的最优示范集。
- 最终通过加权投票生成预测结果,权重基于NWGM近似方法获得,以确保推理过程的鲁棒性与无偏性。
实验结果
研究问题
- RQ1在不访问模型参数或logits的情况下,前门调整能否有效应用于去偏大语言模型的提示?
- RQ2思维链推理如何作为因果干预中有效的中介变量?
- RQ3将对比学习与聚类相结合,能在多大程度上提升基于提示推理中因果效应估计的准确性?
- RQ4所提出的方法是否能在不同大语言模型架构和数据分布(包括对抗性样本)上实现泛化?
- RQ5聚类和对比学习等独立组件在因果提示框架整体性能中分别起到何种贡献?
主要发现
- 在LLaMA2-7b和GPT-3.5模型上,因果提示在ABSAT和NLI数据集的原始版本与对抗性版本中均实现了最高整体性能。
- 在对抗性数据上,因果提示显著优于CoT-SC及其他基线方法,表现出对分布偏移的强大鲁棒性。
- 该方法在分布外(对抗性)数据上的性能提升幅度大于在分布内数据上的提升,表明其具备有效的偏见缓解能力。
- 消融实验表明,移除聚类组件导致的性能下降大于移除对比学习,凸显其在准确估计因果效应中的关键作用。
- 利用对比学习将编码器与大语言模型对齐,可实现更精确的表示学习,从而提升整体因果干预的质量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。