[论文解读] Instructed to Bias: Instruction-Tuned Language Models Exhibit Emergent Cognitive Bias
本文研究了在大型语言模型(LLMs)中,指令微调和人类反馈如何诱发或放大认知偏差——具体为沉锚效应、确定性效应和信念偏差——通过将经典的人类决策实验适配至LLMs进行测试。研究发现,与预训练模型相比,经过指令微调的模型(如Flan-T5、GPT-3.5和GPT-4)表现出显著的偏差,且准确率提升与偏差得分升高相关,表明性能与公平性之间存在权衡。
Recent studies show that instruction tuning (IT) and reinforcement learning from human feedback (RLHF) improve the abilities of large language models (LMs) dramatically. While these tuning methods can help align models with human objectives and generate high-quality text, not much is known about their potential adverse effects. In this work, we investigate the effect of IT and RLHF on decision making and reasoning in LMs, focusing on three cognitive biases - the decoy effect, the certainty effect, and the belief bias - all of which are known to influence human decision-making and reasoning. Our findings highlight the presence of these biases in various models from the GPT-3, Mistral, and T5 families. Notably, we find a stronger presence of biases in models that have undergone instruction tuning, such as Flan-T5, Mistral-Instruct, GPT3.5, and GPT4. Our work constitutes a step toward comprehending cognitive biases in instruction-tuned LMs, which is crucial for the development of more reliable and unbiased language models.
研究动机与目标
- 调查指令微调和从人类反馈中强化学习(RLHF)是否在大型语言模型中诱发或放大认知偏差。
- 检验指令微调的LLM中是否存在并程度如何体现三种核心人类认知偏差——沉锚效应、确定性效应和信念偏差。
- 比较预训练模型与其指令微调变体之间的偏差水平,特别聚焦于GPT-3、GPT-3.5、GPT-4和Flan-T5。
- 分析模型准确率与偏差得分之间的关系,特别是在逻辑推理任务中。
- 提供实证证据表明,旨在提升对齐性的微调方法可能无意中嵌入或放大认知偏差。
提出的方法
- 将经典的人类认知偏差实验改编为文本决策任务,设置对照组与处理组以测试LLMs。
- 使用带有可变数值和文本占位符的模板提示,大规模半自动生成数据集,每种偏差对应一组。
- 将偏差定义为所有提示中,模型在对照组与处理组之间选择偏移的平均值。
- 在相同偏差任务上评估多个LLM(包括GPT-3、GPT-3.5、GPT-4和Flan-T5),以比较不同模型类型的偏差水平。
- 量化模型在信念偏差任务中的准确率与偏差得分,以评估性能与偏差之间的权衡。
- 使用统计分析比较不同模型及其变体(包括预训练与指令微调版本)之间的偏差得分。
实验结果
研究问题
- RQ1指令微调的语言模型是否表现出如沉锚效应、确定性效应和信念偏差等认知偏差?
- RQ2指令微调模型中的偏差水平与它们的预训练前身相比如何?
- RQ3在推理任务中,模型准确率的提升是否与认知偏差的增加存在相关性?
- RQ4不同指令微调模型(如GPT-3.5与GPT-4)是否表现出不同程度的偏差?其差异原因是什么?
- RQ5LLM中认知偏差的存在是否可归因于微调过程本身,而非模型架构的固有特性?
主要发现
- 如GPT-3.5和GPT-4等指令微调模型表现出强烈的确定性效应,倾向于选择确定性结果而非期望值更高的风险选项,而其预训练版本则无此倾向。
- Flan-T5 XXL模型在沉锚效应上的偏差得分为–0.18,表明其始终偏好更昂贵的目标选项,与典型偏差模式相悖。
- 在信念偏差任务中,GPT-3系列模型的准确率越高,其偏差得分也越高,表明存在性能与偏差之间的权衡。
- GPT-4在信念偏差任务中达到最高准确率(84%),且偏差得分(0.07和0.49)低于GPT-3.5和GPT-3.0,表明针对性训练可能降低偏差。
- 本研究发现,指令微调可能放大或引入预训练模型中不存在的认知偏差,尤其在决策与推理任务中。
- LLM中的偏差模式与人类行为不同——例如,Flan-T5对高价选项的一贯偏好违背了典型认知偏差逻辑,表明存在独特的模型特异性行为。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。