Skip to main content
QUICK REVIEW

[论文解读] Large Language Models Can Infer Personality from Free-Form User Interactions

Heinrich Peters, Moran Cerf|arXiv (Cornell University)|May 19, 2024
Mental Health via Writing被引用 4
一句话总结

本研究表明,基于GPT-4的聊天机器人能够以中等准确度从用户自由形式的互动中推断大五人格特质,其表现优于静态文本方法。当聊天机器人被提示主动获取与人格相关的信息时,准确度达到最高(平均 r = .443),且未对用户体验造成负面影响,凸显了大型语言模型在自然情境下实现可扩展、动态心理画像的潜力。

ABSTRACT

This study investigates the capacity of Large Language Models (LLMs) to infer the Big Five personality traits from free-form user interactions. The results demonstrate that a chatbot powered by GPT-4 can infer personality with moderate accuracy, outperforming previous approaches drawing inferences from static text content. The accuracy of inferences varied across different conversational settings. Performance was highest when the chatbot was prompted to elicit personality-relevant information from users (mean r=.443, range=[.245, .640]), followed by a condition placing greater emphasis on naturalistic interaction (mean r=.218, range=[.066, .373]). Notably, the direct focus on personality assessment did not result in a less positive user experience, with participants reporting the interactions to be equally natural, pleasant, engaging, and humanlike across both conditions. A chatbot mimicking ChatGPT's default behavior of acting as a helpful assistant led to markedly inferior personality inferences and lower user experience ratings but still captured psychologically meaningful information for some of the personality traits (mean r=.117, range=[-.004, .209]). Preliminary analyses suggest that the accuracy of personality inferences varies only marginally across different socio-demographic subgroups. Our results highlight the potential of LLMs for psychological profiling based on conversational interactions. We discuss practical implications and ethical challenges associated with these findings.

研究动机与目标

  • 探究大型语言模型(LLMs)是否能够从动态、自由形式的用户互动中推断大五人格特质。
  • 比较不同对话提示条件下人格推断的准确性:人格评估、自然对话和助手模式。
  • 评估在不同互动设置下,推断准确度与用户体验之间的潜在权衡。
  • 检验在性别、年龄、种族、教育水平和社会经济地位方面,基于LLM的人格推断是否存在可测量的群体偏差。
  • 探讨在现实应用中大规模、无感心理画像的伦理与实际影响。

提出的方法

  • 在Prolific Academic平台上对566名美国参与者实施了3×2的被试内实验设计。
  • 在三种不同提示条件下使用GPT-4作为基于LLM的聊天机器人:人格评估、自然对话和实用助手模式。
  • 收集用户自由形式的对话互动,其中用户或自然参与交流,或出于个人目的使用聊天机器人。
  • 向参与者发放大五人格量表-10(BFI-10),以获取真实人格得分用于对比。
  • 计算LLM推断的人格得分与自报的BFI-10得分之间在各特质和条件下的零阶相关系数(r)。
  • 使用标准化量表评估用户体验,包括互动的自然性、愉悦度、参与度和人性化程度。

实验结果

研究问题

  • RQ1基于LLM的聊天机器人是否能够以高于静态文本方法的准确度,从自由形式的用户互动中推断大五人格特质?
  • RQ2对话提示策略(例如人格评估与自然对话)如何影响人格推断的准确性?
  • RQ3提示LLM专注于人格评估是否会相比更自然或类似助手的互动,对用户体验产生负面影响?
  • RQ4在性别、年龄、种族、教育水平和社会经济地位方面,基于LLM的人格推断是否存在可测量的群体偏差?
  • RQ5与简短的任务驱动交流相比,更长或更自然发生的互动在多大程度上能提高人格推断的准确性?

主要发现

  • 被提示主动获取人格相关信息的聊天机器人实现了最高推断准确度,大五人格特质的平均相关系数为 r = .443(范围:.245 至 .640)。
  • 在自然对话条件下,平均相关系数为 r = .218(范围:.066 至 .373),表明准确度中等但低于目标评估条件。
  • 默认的“实用助手”模式准确度最低(平均 r = .117,范围:-.004 至 .209),尽管仍捕捉到部分具有心理意义的信息。
  • 所有条件下用户体验均保持高水平,感知自然性、愉悦度、参与度和人性化程度均无显著差异。
  • 初步分析显示,不同人口统计子群体之间的推断准确度仅存在微小差异,表明模型性能中存在有限的人口统计偏差。
  • 本研究表明,更长或更自然发生的互动可能进一步提升推断准确度,尽管当前结果基于简短互动。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。