[论文解读] Large language models can replicate cross-cultural differences in personality
本研究调查了大型语言模型(LLMs)如GPT-4是否能通过大规模模拟(N=8,000)再现大五人格特质的跨文化差异。研究发现,GPT-4成功再现了美国与韩国文化背景下预期的人格差异,尽管其平均评分存在向上偏差,且变异度低于人类数据。
We use a large-scale experiment (N=8000) to determine whether GPT-4 can replicate cross-cultural differences in the Big Five, measured using the Ten-Item Personality Inventory. We used the US and South Korea as the cultural pair, given that prior research suggests substantial personality differences between people from these two countries. We manipulated the target of the simulation (US vs. Korean), the language of the inventory (English vs. Korean), and the language model (GPT-4 vs. GPT-3.5). Our results show that GPT-4 replicated the cross-cultural differences for each factor. However, mean ratings had an upward bias and exhibited lower variation than in the human samples, as well as lower structural validity. We provide preliminary evidence that LLMs can aid cross-cultural researchers and practitioners.
研究动机与目标
- 检验大型语言模型是否能够模拟人类群体中观察到的文化特异性人格特征。
- 评估LLM生成的人格评分在结构有效性与准确性方面相较于真实人类数据的表现。
- 评估文化目标、评估语言以及模型类型(GPT-4与GPT-3.5)对人格模拟保真度的影响。
- 确定LLM是否可作为跨文化人格研究与实际应用的可靠工具。
- 识别LLM生成人格评分中的系统性偏差,特别是平均分与方差方面。
提出的方法
- 通过大规模实验模拟,使用十项人格量表(TIPI)对8,000个LLM生成的回应进行大五人格特质评估。
- 改变三个关键条件:文化目标(美国 vs. 韩国)、TIPI的语言(英语 vs. 韩语)以及LLM类型(GPT-4 vs. GPT-3.5)。
- 使用GPT-4和GPT-3.5在受控提示下生成模拟来自美国与韩国个体的人格回应。
- 收集并分析不同文化与语言条件下的回应,以比较平均分与内部一致性。
- 通过验证性因子分析检验LLM生成回应的内部因子结构,评估其结构有效性。
- 将LLM生成的人格特征与美国与韩国样本的既有人类数据进行比较,以评估再现准确性。
实验结果
研究问题
- RQ1GPT-4是否能再现人类群体中观察到的美国与韩国之间大五人格特质的跨文化差异?
- RQ2文化目标与评估语言的变化如何影响LLM人格模拟的准确性?
- RQ3LLM生成的人格评分在多大程度上表现出与人类数据相当的结构有效性?
- RQ4LLM生成的人格评分与真实人类回应相比,是否存在平均分或方差方面的系统性偏差?
- RQ5像GPT-4这样的LLM能否作为跨文化人格研究与实际应用的可靠工具?
主要发现
- GPT-4成功再现了美国与韩国文化背景下大五人格特质中所有五个维度的预期跨文化差异。
- LLM生成的人格评分在平均分上表现出一致的向上偏差,相较于两个文化群体的人类数据。
- LLM生成回应的方差显著低于人类样本,表明模拟人格表达的多样性降低。
- LLM生成回应的结构有效性低于人类数据,大五维度的内部因子结构较弱。
- GPT-4与GPT-3.5的模拟准确性一致,尽管GPT-4在与预期文化差异的匹配度上略优。
- 量表语言(英语 vs. 韩语)对差异幅度的影响极小,表明在此情境下模型性能在不同语言间具有鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。