[论文解读] Development and Evaluation of Three Chatbots for Postpartum Mood and Anxiety Disorders
本研究开发并评估了三种聊天机器人——两种基于规则的模型和一种生成式模型——用于为产后护理人员提供共情、上下文相关的支持,针对产后情绪障碍(PPMADs)。基于来自产后支持国际组织(Postpartum Support International)的7,014条真实热线对话数据集,基于规则的模型在共情能力、相关性和用户偏好方面优于生成式模型,而生成式模型则因训练数据的局限性,产生了令人困惑或无意义的回应。
In collaboration with Postpartum Support International (PSI), a non-profit organization dedicated to supporting caregivers with postpartum mood and anxiety disorders, we developed three chatbots to provide context-specific empathetic support to postpartum caregivers, leveraging both rule-based and generative models. We present and evaluate the performance of our chatbots using both machine-based metrics and human-based questionnaires. Overall, our rule-based model achieves the best performance, with outputs that are close to ground truth reference and contain the highest levels of empathy. Human users prefer the rule-based chatbot over the generative chatbot for its context-specific and human-like replies. Our generative chatbot also produced empathetic responses and was described by human users as engaging. However, limitations in the training dataset often result in confusing or nonsensical responses. We conclude by discussing practical benefits of rule-based vs. generative models for supporting individuals with mental health challenges. In light of the recent surge of ChatGPT and BARD, we also discuss the possibilities and pitfalls of large language models for digital mental healthcare.
研究动机与目标
- 为产后护理人员在面临经济成本、社会污名和医疗资源短缺等障碍时,填补可及性低、成本低的心理健康支持的空白。
- 利用真实的临床对话数据,开发并评估能够提供上下文相关、富有共情能力的回应的聊天机器人,以应对产后情绪障碍(PPMADs)。
- 比较基于规则和生成式模型在数字心理健康护理中的性能、共情能力与可用性。
- 评估大型语言模型(如ChatGPT)在直接数字心理健康应用中存在伦理与实际限制。
提出的方法
- 利用产后支持国际组织(Postpartum Support International)热线的7,014条匿名文本对话数据集进行训练与评估。
- 基于检索式架构开发基于规则的聊天机器人,使用预写好的、与上下文相关的回应,并通过意图识别与实体识别进行映射。
- 基于相同对话数据对大型语言模型(LLM)进行微调,构建生成式聊天机器人,以生成开放式回应。
- 通过自动化指标(如BLEU、ROUGE、BERTScore)和人工评估问卷(评估共情能力、相关性与用户偏好)对模型进行评估。
- 通过用户研究,让真实参与者比较各模型回应的感知质量与情感支持程度。
- 通过向ChatGPT输入典型的产后关切问题,测试其在上下文保持、事实准确性与伦理适当性方面的局限性。
实验结果
研究问题
- RQ1基于规则与生成式聊天机器人在为产后护理人员提供上下文相关、富有共情能力的回应方面表现如何比较?
- RQ2训练数据质量与模型架构对心理健康聊天机器人回应连贯性与共情能力有何影响?
- RQ3在缺乏人工监管的情况下,像ChatGPT这样的大型语言模型能否在直接数字心理健康护理中伦理且有效地使用?
- RQ4用户如何感知基于规则与生成式模型在共情能力、相关性与可信度方面的回应?
- RQ5生成式模型在情绪敏感对话中,能在多大程度上保持上下文连贯性,并避免产生无意义或有害的回应?
主要发现
- 基于规则的聊天机器人在机器评估指标中表现最佳,其回应最接近真实参考答案,且共情评分最高。
- 人类用户更偏好基于规则的聊天机器人,因其回应具有上下文相关性、连贯性与类人特征。
- 生成式聊天机器人虽能产生富有共情的回应,并被认为具有互动性,但常因训练数据集的局限性而生成令人困惑或无意义的回复。
- ChatGPT无法在对话中保持上下文连贯性,例如错误地将‘him’识别为成年人而非婴儿,从而在情绪敏感互动中削弱用户信任。
- 即使经过仔细提示,ChatGPT的回应在伦理上也不适合用于心理健康护理,因其可能提供错误或有害的建议。
- 由于缺乏情境理解能力、伦理约束以及错误修正能力差,像ChatGPT这样的大型语言模型无法在无人工监管的情况下直接部署于数字心理健康护理中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。