[论文解读] Exploring The Design of Prompts For Applying GPT-3 based Chatbots: A Mental Wellbeing Case Study on Mechanical Turk
本研究进行了一项随机因子实验(N=945),研究提示设计(身份、意图、行为)如何影响基于 GPT-3 的情绪支持聊天机器人,包含定量评估和定性对话分析。
Large-Language Models like GPT-3 have the potential to enable HCI designers and researchers to create more human-like and helpful chatbots for specific applications. But evaluating the feasibility of these chatbots and designing prompts that optimize GPT-3 for a specific task is challenging. We present a case study in tackling these questions, applying GPT-3 to a brief 5-minute chatbot that anyone can talk to better manage their mood. We report a randomized factorial experiment with 945 participants on Mechanical Turk that tests three dimensions of prompt design to initialize the chatbot (identity, intent, and behaviour), and present both quantitative and qualitative analyses of conversations and user perceptions of the chatbot. We hope other HCI designers and researchers can build on this case study, for other applications of GPT-3 based chatbots to specific tasks, and build on and extend the methods we use for prompt design, and evaluation of the prompt design.
研究动机与目标
- 在受控环境中探索 GPT-3 聊天机器人执行简短情绪管理任务的可行性。
- 研究提示修改项(身份、意图、行为)如何影响用户感知和对话动态。
- 提供在人机交互中对提示设计的探索与评估的方法框架。
- 展示比试点研究更大规模的数据收集与分析方法(定量调查和定性日志)。
提出的方法
- 采用因子实验设计(2 x 3 x 3)来测试将身份、意图和行为修改结合成的18种提示臂。
- 向 945 名 MTurk 参与者部署一个5分钟的开放式情绪支持聊天机器人,控制互动时长并披露其为 AI。
- 收集感知风险、信任、专业度和再次互动意愿等量表,以及用于定性分析的对话日志。
- 进行参与者评论的定性主题分析,并检查跨提示条件的对话动态。
- 分析人口统计和技术亲和变量,以了解响应中的异质性(如以往的心理健康帮助史、技术偏好)。
- 提供开源聊天界面与方法学,以实现可重复性和进一步的提示工程研究。
实验结果
研究问题
- RQ1不同的提示修改项(身份、意图、行为)如何影响用户对基于 GPT-3 的聊天机器人在风险、信任、专业度以及再次互动意愿的感知?
- RQ2在不同提示设置下使用 GPT-3 聊天机器人进行情绪管理时,5 分钟对话中出现了哪些定性模式?
- RQ3人口统计因素或以往的心理健康帮助史是否会在不同提示设计下改变对 GPT-3 聊天机器人的反应?
- RQ4因子提示设计是否能揭示主效应或交互作用,从而为任务特定的聊天机器人提供更好的提示工程指南?
主要发现
- 参与者展现出中等偏高的感知风险、中等信任、高感知专业度,以及中等的再次互动意愿。
- 以往寻求心理健康帮助的历史显著影响所有四个评估维度,风险更高、信任下降、专业度相似、再次互动意愿更高。
- 对技术的更积极态度往往与更高的感知风险、较低的信任、更高的专业度以及更高的再次互动意愿相关。
- 定性主题显示总体上是正向互动(约70%),数据隐私担忧是主要的负面主题(约30%)。
- Friend 与 Coach 身份在对话动态上没有明确的定性/定量趋势,但Friend 往往会引发稍长的用户回应;Intent 似乎比 Identity 或 Behavior 更影响字数。
- CBT 与 Problem-Solving 意图往往产生更长、更具指令性的对话,而 Open-Ended 反思提示有时会产生较短的交流;总体上,对话动态因意图实现而异。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。