Skip to main content
QUICK REVIEW

[论文解读] Quantifying the Persona Effect in LLM Simulations

Tiancheng Hu, Nigel Collier|arXiv (Cornell University)|Feb 16, 2024
Human-Automation Interaction and SafetyPsychology被引用 3
一句话总结

本研究量化了人格变量(如人口统计学特征、态度和生活经历)对主观自然语言处理任务中人类标注的影响,并评估了通过人格提示提升大语言模型(LLM)模拟能力的实用性。研究发现,人格变量在大多数数据集中解释的方差不足10%,限制了人格提示的有效性;当方差解释度较高时,人格提示仅带来适度的性能提升,而当人格变量实用性较低时,其表现则较差。

ABSTRACT

Large language models (LLMs) have shown remarkable promise in simulating human language and behavior. This study investigates how integrating persona variables-demographic, social, and behavioral factors-impacts LLMs' ability to simulate diverse perspectives. We find that persona variables account for <10% variance in annotations in existing subjective NLP datasets. Nonetheless, incorporating persona variables via prompting in LLMs provides modest but statistically significant improvements. Persona prompting is most effective in samples where many annotators disagree, but their disagreements are relatively minor. Notably, we find a linear relationship in our setting: the stronger the correlation between persona variables and human annotations, the more accurate the LLM predictions are using persona prompting. In a zero-shot setting, a powerful 70b model with persona prompting captures 81% of the annotation variance achievable by linear regression trained on ground truth annotations. However, for most subjective NLP datasets, where persona variables have limited explanatory power, the benefits of persona prompting are limited.

研究动机与目标

  • 评估人格变量在主观自然语言处理任务中的人类标注方差解释程度。
  • 评估通过提示工程引入人格变量是否能提升大语言模型在模拟主观自然语言标注中多样化视角方面的能力。
  • 识别在哪些类型的数据样本上人格提示能带来最大改进。
  • 考察人格变量的解释能力与大语言模型在人格模拟中性能提升之间的线性关系。
  • 为数据集设计提供建议,并谨慎使用大语言模型模拟人类视角。

提出的方法

  • 使用R²统计量,在四个主观自然语言处理数据集中测量人格变量对人类标注方差的解释比例。
  • 通过在输入提示前添加人格描述(如人口统计学特征、态度等)实施人格提示,随后进行大语言模型推理。
  • 使用相关系数和R²指标评估大语言模型的性能,比较模型预测与人类标注结果。
  • 通过控制文本随机性并改变人格变量的实用性,开展受控实验以隔离模型的模拟能力。
  • 采用大规模、指令微调的大语言模型(如Llama 3、Mixtral)评估不同模型规模下的性能表现。
  • 对提示措辞和人格顺序进行稳健性检验,以确保结果的一致性。

实验结果

研究问题

  • RQ1RQ1:人格变量能解释人类标注中的多少方差?
  • RQ2RQ2:通过提示工程引入人格变量能否提升大语言模型的预测能力?
  • RQ3RQ3:在哪些类型的数据样本上人格提示最为有效?
  • RQ4RQ4:当人格变量的实用性变化且文本随机性被控制时,大语言模型在人格模拟中的表现如何?

主要发现

  • 在大多数主观自然语言处理数据集中,人格变量解释的人类标注方差不足10%。
  • 人格提示带来的人类标注预测性能提升有限,且仅在人格变量能解释显著方差时才出现。
  • 大语言模型预测性能提升最显著的样本,是标注者意见分歧频繁且集中于狭窄范围的样本。
  • 人格变量解释的方差比例与大语言模型预测性能提升之间存在线性关系。
  • 当人格变量实用性高时,大型微调大语言模型可解释高达81%的人类响应方差,但当R² < 0.1时,性能会降至接近零。
  • 大多数现有自然语言处理数据集属于低实用性类别(R² < 0.1),限制了当前自然语言处理研究中人格提示的实际有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。