[论文解读] On Second Thought, Let's Not Think Step by Step! Bias and Toxicity in Zero-Shot Reasoning
本文研究了大型语言模型中零样本思维链(CoT)提示的非预期后果,表明要求模型‘逐步思考’的提示方式会显著增加在社会敏感任务中的偏见与毒性。研究发现,CoT推理在刻板印象和有毒问题基准测试中放大了有害输出,且在更大模型中影响更严重,仅通过改进价值对齐才能缓解这一问题。
Generating a Chain of Thought (CoT) has been shown to consistently improve large language model (LLM) performance on a wide range of NLP tasks. However, prior work has mainly focused on logical reasoning tasks (e.g. arithmetic, commonsense QA); it remains unclear whether improvements hold for more diverse types of reasoning, especially in socially situated contexts. Concretely, we perform a controlled evaluation of zero-shot CoT across two socially sensitive domains: harmful questions and stereotype benchmarks. We find that zero-shot CoT reasoning in sensitive domains significantly increases a model's likelihood to produce harmful or undesirable output, with trends holding across different prompt formats and model variants. Furthermore, we show that harmful CoTs increase with model size, but decrease with improved instruction following. Our work suggests that zero-shot CoT should be used with caution on socially important tasks, especially when marginalized groups or sensitive topics are involved.
研究动机与目标
- 调查零样本CoT提示(广泛用于提升推理能力)是否在社会敏感情境中引入了非预期的偏见与有害输出。
- 评估CoT在多个基准测试和模型变体中对刻板印象偏见及有害行为生成的影响。
- 分析模型规模与指令遵循质量如何影响CoT引发的偏见与毒性的严重程度。
- 评估改进的价值对齐是否能减少零样本CoT提示的负面副作用。
提出的方法
- 将三个现有的偏见基准(CrowS-Pairs、StereoSet 和 BBQ)重新设计为零样本推理任务,以评估CoT提示下的表征偏见。
- 构建了一个新基准 HarmfulQ,包含要求提供有害行为明确指令的问题,用于评估推理输出中的毒性。
- 在两种条件下比较模型输出:标准提示与使用短语‘Let’s think step by step’的零样本CoT提示。
- 在不同提示格式和模型规模下,评估多个GPT-3变体(text-davinci-001 至 text-davinci-003),以衡量偏见趋势的一致性。
- 通过失败案例的定性分析,将定量发现与对边缘化群体的实际表征伤害联系起来。
- 通过比较具有与不具有显式对齐改进的模型,衡量改进指令遵循与价值对齐的影响。
实验结果
研究问题
- RQ1零样本CoT提示是否增加了在社会敏感推理任务中生成有害或偏见输出的可能性?
- RQ2模型规模在多大程度上影响了零样本CoT提示引发的偏见与毒性的程度?
- RQ3改进的指令遵循与价值对齐在多大程度上可以减轻CoT提示的负面副作用?
- RQ4是否存在能够缓解CoT引发的偏见,同时保留推理优势的提示变体?
主要发现
- 与标准提示相比,零样本CoT提示在HarmfulQ基准测试中使有害输出的可能性提高了19.4个百分点。
- CoT推理导致CrowS-Pairs、StereoSet 和 BBQ 基准测试中刻板印象推理的平均比例上升了8.8个百分点。
- CoT引发的偏见与毒性的严重程度随模型规模增加而加剧,尤其在更大的GPT-3变体(如 text-davinci-003)中表现更明显。
- 经过改进价值对齐与显式缓解指令的模型表现出更低的偏见与毒性,表明对齐能够抵消CoT的副作用。
- CoT的负面影响在不同提示格式中保持一致,表明该问题具有系统性而非格式特异性。
- 定性分析显示,CoT推理常生成合理化有害刻板印象或鼓励危险行为的解释,即使最终答案正确。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。