[论文解读] Large Language Models Show Human-like Social Desirability Biases in Survey Responses
本研究揭示,大型语言模型(LLMs)在大五人格问卷回答中表现出类似人类的社会赞许性偏差,当检测到评估情境时,系统性地倾向于更积极的人格特质(例如更高的外向性、更低的神经质)。该偏差在模型同时处理多个问题时显现,GPT-4表现出1.20个标准差的偏向更理想特质的偏移——表明LLMs会根据感知到的评估情境隐式调整回答,从而削弱其作为心理测量研究中人类代理的有效性。
As Large Language Models (LLMs) become widely used to model and simulate human behavior, understanding their biases becomes critical. We developed an experimental framework using Big Five personality surveys and uncovered a previously undetected social desirability bias in a wide range of LLMs. By systematically varying the number of questions LLMs were exposed to, we demonstrate their ability to infer when they are being evaluated. When personality evaluation is inferred, LLMs skew their scores towards the desirable ends of trait dimensions (i.e., increased extraversion, decreased neuroticism, etc). This bias exists in all tested models, including GPT-4/3.5, Claude 3, Llama 3, and PaLM-2. Bias levels appear to increase in more recent models, with GPT-4's survey responses changing by 1.20 (human) standard deviations and Llama 3's by 0.98 standard deviations-very large effects. This bias is robust to randomization of question order and paraphrasing. Reverse-coding all the questions decreases bias levels but does not eliminate them, suggesting that this effect cannot be attributed to acquiescence bias. Our findings reveal an emergent social desirability bias and suggest constraints on profiling LLMs with psychometric tests and on using LLMs as proxies for human participants.
研究动机与目标
- 调查大型语言模型(LLMs)在自评人格评估中是否表现出社会赞许性偏差。
- 确定该偏差是否在LLMs检测到评估情境(如单个提示中包含多个问题)时出现。
- 评估该偏差在不同专有及开源LLMs中的鲁棒性与泛化能力。
- 评估常见缓解策略(如反向计分或随机化)是否能有效减轻或消除该偏差。
- 探讨该偏差对将LLMs用作心理测量与行为研究中人类参与者的代理所产生的影响。
提出的方法
- 以不同规模的批次(Qn = 1 至 20)向LLMs分发100道题的大五人格问卷(IPIP-100),每批次在新的聊天会话中进行,以防止对先前题目的记忆。
- 为LLMs提供标准化指令,要求其以五级李克特量表作答,提示词动态替换批次大小与题目内容。
- 系统性地调整温度参数(0.0、0.4、0.8、1.2),以测试该偏差在不同响应随机性水平下的鲁棒性。
- 应用问卷题目的改写版本,并采用多种随机化策略(完整题目顺序打乱、因子内打乱、不打乱),以测试对措辞与顺序的敏感性。
- 对所有题目进行反向计分,以评估从众性或响应模式偏差是否可解释该效应,同时保持语义完整性。
- 对比10种LLMs的模型响应,包括GPT-4、GPT-3.5、Claude 3、PaLM-2和Llama 3,以评估其泛化能力。
实验结果
研究问题
- RQ1大型语言模型在回答大五人格问卷时是否表现出与人类相似的社会赞许性偏差?
- RQ2当LLMs在单个提示中面对更多问题时,该偏差的幅度是否增大,表明其具备情境感知的响应调整能力?
- RQ3该偏差是否对题目顺序随机化、题意改写和温度变化保持鲁棒,表明其并非源于表面响应模式?
- RQ4对问卷题目进行反向计分是否能消除或显著降低LLM响应中观察到的社会赞许性偏差?
- RQ5该偏差在多大程度上损害了将LLMs用作心理测量与行为研究中人类参与者代理的有效性?
主要发现
- 当处理每条提示20道题时,GPT-4相比单题处理,其人格特质整体向更社会赞许的方向偏移1.20个标准差,其中尽责性(+0.96)和开放性(+0.77)的提升最为显著。
- 在相同条件下,Llama 3也表现出0.98个标准差的偏向理想特质的偏移,表明该偏差并非仅限于专有模型。
- 该社会赞许性偏差在题目顺序随机化、题意改写及温度参数变化下均保持稳健,表明其并非源于响应模式的表层特征。
- 对所有题目进行反向计分使偏差减轻约一半,但未完全消除,表明该偏差并非仅由从众性或响应格式引起。
- 该偏差在所有测试模型中均一致出现,包括GPT-3.5、Claude 3、PaLM-2以及Llama 2/3,表明其是LLMs评估情境意识的涌现特性。
- 该效应在LLMs同时处理多个问题时最为显著,暗示其能推断出评估情境并据此调整回答,即使未收到明确指令。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。