[论文解读] On the Effectiveness of Creating Conversational Agent Personalities Through Prompting
本研究利用 GPT-3.5 和 GPT-4 在对话智能体中探究基于提示的个性工程,借助慈善募捐领域的知识定义了三个个性维度——态度(乐观/悲观)、权威(权威/从属)和推理(分析性/情感性)。通过 LIWC 分析发现,GPT-4 在 19 个 LIWC 类别中有 12 个能显著区分提示的个性特征,而 GPT-3.5 仅有 4 个,表明模型性能存在差异,且需优化提示策略以确保个性表达的持续性和一致性。
In this work, we report on the effectiveness of our efforts to tailor the personality and conversational style of a conversational agent based on GPT-3.5 and GPT-4 through prompts. We use three personality dimensions with two levels each to create eight conversational agents archetypes. Ten conversations were collected per chatbot, of ten exchanges each, generating 1600 exchanges across GPT-3.5 and GPT-4. Using Linguistic Inquiry and Word Count (LIWC) analysis, we compared the eight agents on language elements including clout, authenticity, and emotion. Four language cues were significantly distinguishing in GPT-3.5, while twelve were distinguishing in GPT-4. With thirteen out of a total nineteen cues in LIWC appearing as significantly distinguishing, our results suggest possible novel prompting approaches may be needed to better suit the creation and evaluation of persistent conversational agent personalities or language styles.
研究动机与目标
- 探究大型语言模型(LLMs)是否可通过提示工程在对话智能体中持续表达出明确的个性特征。
- 评估 GPT-3.5 和 GPT-4 在生成与慈善募捐文献中推导出的特定个性原型相匹配的语言风格方面的保真度。
- 识别哪些个性维度(态度、权威、推理)对 LLM 生成对话中的语言输出具有最显著影响。
- 为提升基于 LLM 的对话智能体中个性表达的一致性和持久性,提出可操作的提示策略建议。
提出的方法
- 基于三个二元维度(态度:乐观/悲观;权威:权威/从属;推理:分析性/情感性)定义了八个个性原型。
- 使用 GPT-3.5 和 GPT-4 生成每个智能体 10 场对话(每场 10 次交互),共产生 1600 次交互。
- 应用语言学调查与词频统计(LIWC)分析,测量 19 个心理语言学词典类别的语言特征。
- 通过统计检验识别在每种模型中,哪些 LIWC 类别能显著区分不同个性原型。
- 评估每个个性维度对语言输出的影响,并分析模型对提示个性特征的敏感性。
- 提出新型提示策略,包括同义词注入、周期性提示重注入,以及基于实时 LIWC 的反馈回路以缓解个性漂移。
实验结果
研究问题
- RQ1RQ1:通过提示工程生成的语言是否与个性特征与语言模式之间的既定关联相一致?
- RQ2RQ2:GPT-3.5 和 GPT-4 在多个语言维度上表达提示个性特征的能力有何差异?
- RQ3RQ3:态度、权威、推理这三个个性维度中,哪一个对 LLM 生成对话的语言输出影响最显著?
- RQ4RQ4:能否通过实时监控 LIWC 类别实现对对话智能体个性漂移的反馈式纠正?
主要发现
- GPT-4 在与提示个性特征的对齐方面显著优于 GPT-3.5,19 个 LIWC 类别中有 12 个能显著区分不同个性原型。
- GPT-3.5 仅在 19 个 LIWC 类别中的 4 个显示出显著区分,表明其对提示个性差异的敏感性有限。
- 态度维度在两个模型中均对语言输出产生最显著影响,尤其在情绪和气势相关类别中表现突出。
- 权威维度对 GPT-4 的影响强于对 GPT-3.5 的影响,表明模型对特定个性特征存在差异化的敏感性。
- 推理维度在两个模型中影响最弱,表明分析性与情感性风格之间的语言区分度较低。
- 尽管有所改进,但两个模型在全部 19 个 LIWC 类别中仍缺乏足够一致性,凸显了需要采用更先进的提示技术以确保个性表达的持久性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。