[论文解读] Challenging the Validity of Personality Tests for Large Language Models
本文质疑了将人类人格测试(特别是IPIP大五人格和BFI-2)用于评估大型语言模型(LLMs)的有效性。研究显示,LLMs系统性地无法复现人类的响应模式,例如对正向和负向表述的项目产生不一致的肯定回答,且未表现出人类数据中可见的五因素结构,表明人格测试无法可靠地推断LLMs中的人格类似特质。
With large language models (LLMs) like GPT-4 appearing to behave increasingly human-like in text-based interactions, it has become popular to attempt to evaluate personality traits of LLMs using questionnaires originally developed for humans. While reusing measures is a resource-efficient way to evaluate LLMs, careful adaptations are usually required to ensure that assessment results are valid even across human subpopulations. In this work, we provide evidence that LLMs' responses to personality tests systematically deviate from human responses, implying that the results of these tests cannot be interpreted in the same way. Concretely, reverse-coded items ("I am introverted" vs. "I am extraverted") are often both answered affirmatively. Furthermore, variation across prompts designed to "steer" LLMs to simulate particular personality types does not follow the clear separation into five independent personality factors from human samples. In light of these results, we believe that it is important to investigate tests' validity for LLMs before drawing strong conclusions about potentially ill-defined concepts like LLMs' "personality".
研究动机与目标
- 调查专为人类设计的人格测试在应用于大型语言模型(LLMs)时是否有效。
- 评估LLMs是否在标准心理问卷测量下表现出一致且可解释的人格特质。
- 评估人格的五因素结构(如外向性、神经质)是否在LLM的响应中成立。
- 确定测量不变性——对有效测试迁移至关重要的特性——是否适用于从人类到LLMs的迁移。
- 警告不要将LLM对人格测试的响应解释为新兴人格特质的证据。
提出的方法
- 向多个LLMs(如GPT-3.5、Llama 2)发放50项IPIP大五人格标记问卷,以分析其响应模式。
- 通过提示工程引导LLMs在回答BFI-2问卷时模拟特定人格类型。
- 应用验证性因子分析(CFA)检验LLM响应是否符合既定的人格五因素模型。
- 使用标准拟合指数评估模型拟合度:比较拟合指数(CFI)、Tucker-Lewis指数(TLI)和近似均方根误差(RMSEA)。
- 计算McDonald的层次α(ωh)以评估LLM响应中因子结构的内部一致性和可靠性。
- 比较LLM与人类样本的CFA结果,以检验测量不变性和结构有效性。

实验结果
研究问题
- RQ1LLMs是否以与人类响应模式一致的方式回应人格测试?
- RQ2能否从LLM对BFI-2的响应中可靠地恢复人格的五因素结构?
- RQ3反向计分项目(如“我是内向的”与“我是外向的”)是否能引发LLM的一致且无矛盾的响应?
- RQ4当从人类转移到LLMs时,人格测试的测量不变性是否得以保持?
- RQ5LLM人格测试结果在多大程度上可被解释为新兴人格特质的证据?
主要发现
- LLMs频繁同时肯定正向和负向表述的项目(如“我是内向的”和“我是外向的”),表明存在系统性的响应不一致。
- 验证性因子分析(CFA)显示,所有LLMs在BFI-2五因素模型上的拟合度均较差,CFI < 0.95且RMSEA > 0.06。
- 即使将模型扩展为每种特质包含三个子因素,LLM响应也未能达到可接受的拟合指数,而人类数据则可以。
- 包含一般因子和子因素的分层CFA模型在15次中有8次未能收敛,表明结构不稳定。
- 由于模型收敛问题和拟合度差,大多数LLMs无法可靠计算McDonald的层次α(ωh)。
- LLM对人格测试的响应未能复现人类样本中观察到的潜在因子结构,从而削弱了人格推断的有效性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。