Skip to main content
QUICK REVIEW

[论文解读] Identifying and Manipulating the Personality Traits of Language Models

Graham Caron, Shashank Srivastava|arXiv (Cornell University)|Dec 20, 2022
Topic Modeling被引用 13
一句话总结

本文提出一种基于'大五人格'人格框架的心理测量问卷方法,用于识别和控制语言模型的感知人格特质。通过注入自我报告描述或Reddit帖子等上下文信息,作者证明了像BERT和GPT2这样的模型能够以高度可预测性反映特定人格特质,预期与观察到的特质变化之间的皮尔逊相关系数中位数高达0.84。

ABSTRACT

Psychology research has long explored aspects of human personality such as extroversion, agreeableness and emotional stability. Categorizations like the `Big Five' personality traits are commonly used to assess and diagnose personality types. In this work, we explore the question of whether the perceived personality in language models is exhibited consistently in their language generation. For example, is a language model such as GPT2 likely to respond in a consistent way if asked to go out to a party? We also investigate whether such personality traits can be controlled. We show that when provided different types of contexts (such as personality descriptions, or answers to diagnostic questions about personality traits), language models such as BERT and GPT2 can consistently identify and reflect personality markers in those contexts. This behavior illustrates an ability to be manipulated in a highly predictable way, and frames them as tools for identifying personality traits and controlling personas in applications such as dialog systems. We also contribute a crowd-sourced data-set of personality descriptions of human subjects paired with their `Big Five' personality assessment data, and a data-set of personality descriptions collated from Reddit.

研究动机与目标

  • 探究语言模型在文本生成中是否表现出一致且可识别的人格特质。
  • 探究通过人格描述或诊断性问题等上下文输入,是否可操控模型所呈现的人格特质。
  • 开发并发布两个新数据集:一个包含人类自我报告的人格描述与大五人格评分的配对数据,另一个来自公开的Reddit帖子。
  • 评估语言模型是否能基于文本描述准确预测人类用户的大五人格特质,从而为个性化AI系统提供潜在应用。
  • 考察模型行为中的潜在偏见,包括在感知人格特质方面是否存在基于性别的差异,并评估AI中人格操控的伦理影响。

提出的方法

  • 将'大五人格'人格框架的心理测量问卷改编,通过模型生成的回应探测语言模型的感知特质。
  • 使用上下文提示(如人格描述、调查回答和Reddit帖子)来调节模型输出,从而影响其感知人格。
  • 在HuggingFace的BERT和GPT2上训练逻辑回归分类器,基于模型生成的回应预测人格特质得分。
  • 通过计算预测与预期人格得分之间的皮尔逊相关系数,量化人格特质操控的可预测性。
  • 通过Amazon Mechanical Turk收集并整理了100名人类受试者的众包数据集,包含自我报告的人格描述及对应的大五人格评估得分。
  • 爬取并聚合公开的Reddit帖子,形成第二个非正式人格描述的数据集,用于模型探测。

实验结果

研究问题

  • RQ1当使用上下文描述作为提示时,语言模型是否能在其文本生成中一致地反映特定人格特质?
  • RQ2通过精心设计的上下文输入,语言模型所呈现的人格特质在多大程度上可被控制?
  • RQ3语言模型能否基于用户自我报告的文本描述准确预测其大五人格特质?
  • RQ4当使用带有性别的姓名作为提示时,语言模型在人格特质感知上是否表现出性别偏见?
  • RQ5预训练数据和模型架构在多大程度上影响感知人格的出现及其可塑性?

主要发现

  • 当使用上下文提示时,BERT和GPT2等语言模型在反映人格特质方面表现出高度一致性,预期与观察到的特质变化之间的皮尔逊相关系数中位数分别为0.84和0.81。
  • 当提供人类自我报告的人格描述时,语言模型预测对应的大五人格得分,相关系数最高达0.48,表明具备可测量的预测能力。
  • BERT和GPT2在女性标识姓名上表现出更高的一致性、尽责性和情绪稳定性得分,与心理学文献一致,但情绪稳定性(神经质)方面存在差异。
  • GPT2在男性标识姓名上表现出更高的外向性和开放性得分,而BERT则无显著差异,表明存在模型特异的性别偏见模式。
  • 使用基于Reddit的描述作为上下文,可一致地操控感知人格特质,证明了利用非正式公开文本实现人格控制的可行性。
  • 本研究发布了两个数据集:一个包含100名受试者的自我报告描述与大五人格得分,另一个包含1000条基于Reddit的人格描述,均对研究用途公开可用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。