[论文解读] How Well Can LLMs Echo Us? Evaluating AI Chatbots' Role-Play Ability with ECHO
本文提出了ECHO,一种受图灵测试启发的框架,通过真实个人资料评估大型语言模型(LLMs)在扮演普通个体时的表现。结果显示,GPTs在欺骗熟人方面的成功率达到48.3%,优于GPT-3.5和GPT-4;而GPT-4等LLMs虽能有效识别机器生成文本,却难以准确判断人类撰写的文本,暴露出模型特有的偏见。
The role-play ability of Large Language Models (LLMs) has emerged as a popular research direction. However, existing studies focus on imitating well-known public figures or fictional characters, overlooking the potential for simulating ordinary individuals. Such an oversight limits the potential for advancements in digital human clones and non-player characters in video games. To bridge this gap, we introduce ECHO, an evaluative framework inspired by the Turing test. This framework engages the acquaintances of the target individuals to distinguish between human and machine-generated responses. Notably, our framework focuses on emulating average individuals rather than historical or fictional figures, presenting a unique advantage to apply the Turing Test. We evaluated three role-playing LLMs using ECHO, with GPT-3.5 and GPT-4 serving as foundational models, alongside the online application GPTs from OpenAI. Our results demonstrate that GPT-4 more effectively deceives human evaluators, and GPTs achieves a leading success rate of 48.3%. Furthermore, we investigated whether LLMs could discern between human-generated and machine-generated texts. While GPT-4 can identify differences, it could not determine which texts were human-produced. Our code and results of reproducing the role-playing LLMs are made publicly available via https://github.com/CUHK-ARISE/ECHO.
研究动机与目标
- 填补现有研究中对LLMs模仿普通个体而非名人或虚构角色能力评估的空白。
- 开发一种基于图灵测试的框架,利用真实个人资料评估LLMs在角色扮演场景中的表现。
- 评估LLMs是否能够准确区分人类与机器生成的文本,识别其判断中的潜在偏见。
- 通过保护参与者隐私并获取知情同意,确保数据处理的伦理合规性。
- 提供一个可复现的基准,用于使用真实个人数据评估角色扮演型LLMs。
提出的方法
- ECHO利用十位真实个体的个人背景数据(包括人口统计信息、兴趣爱好和沟通风格)构建角色扮演型LLMs。
- 人类评估者——目标个体的熟人——被要求判断哪些回应是由真实人物生成的,哪些是由LLM生成的。
- 该框架比较了四种角色扮演方法:RoleGPT、Juliet、Role-Play Prompting(RPP)以及OpenAI的GPTs,均以GPT-3.5-Turbo和GPT-4-Turbo作为基础模型。
- 评估涵盖个人经历、偏好和当前情境等领域的十类问题,以检验回应的真实性与连贯性。
- 控制实验评估GPT-4和Gemini-Pro等LLMs区分人类与机器生成文本的能力,测量其准确率与偏见。
- 所有个人数据均在本地处理;不与第三方共享数据,所有响应在六个月后删除,以保障隐私。
实验结果
研究问题
- RQ1LLMs能否在角色扮演场景中有效伪装成普通个体,其表现是否可通过人类评估者区分真实与合成回应的能力来衡量?
- RQ2不同角色扮演方法(如GPTs、RoleGPT、RPP)在欺骗目标个体熟人方面的表现如何比较?
- RQ3LLMs能否准确识别给定文本是由人类还是另一LLM生成的?其判断中是否存在偏见?
- RQ4LLMs在评估人类与机器生成文本时存在哪些固有偏见,特别是在模型相似性或文本长度方面?
- RQ5LLMs在多大程度上无法复现人类细微特征,如情感深度、文化语境和独特的沟通模式?
主要发现
- GPTs在欺骗人类评估者方面取得了最高的48.3%成功率,优于所有其他角色扮演方法中的GPT-3.5和GPT-4。
- GPT-4在角色扮演能力上优于GPT-3.5,其欺骗率在所有测试模型中最高。
- GPT-4与GPT-4-Turbo在区分机器生成与人类生成文本方面均实现了超过90%的成功率,表明其具备强大的检测能力。
- 尽管检测性能出色,GPT-4却无法可靠判断哪些文本是人类撰写的,表明其存在将自身生成模式误判为人类文本的倾向。
- GPT-4表现出显著的指令偏见,在不同设置下准确率差异高达63.5%,表明其在识别机器生成内容时比识别人类内容更具信心。
- LLMs在区分人类与机器生成文本时未表现出显著的长度偏见,该结论通过与控制模型的对比得到验证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。