Skip to main content
QUICK REVIEW

[论文解读] Building Emotional Support Chatbots in the Era of LLMs

Zhonghua Zheng, Lizi Liao|arXiv (Cornell University)|Aug 17, 2023
Mental Health via Writing被引用 12
一句话总结

本论文通过将人工种子对话与LLMs的上下文内生成相结合,构建可扩展的情感支持对话数据集(ExTES),然后使用参数高效方法对基于 LLaMA 的模型进行微调,创建一个情感支持聊天机器人,并评估其质量、安全性和泛化能力。

ABSTRACT

The integration of emotional support into various conversational scenarios presents profound societal benefits, such as social interactions, mental health counseling, and customer service. However, there are unsolved challenges that hinder real-world applications in this field, including limited data availability and the absence of well-accepted model training paradigms. This work endeavors to navigate these challenges by harnessing the capabilities of Large Language Models (LLMs). We introduce an innovative methodology that synthesizes human insights with the computational prowess of LLMs to curate an extensive emotional support dialogue dataset. Our approach is initiated with a meticulously designed set of dialogues spanning diverse scenarios as generative seeds. By utilizing the in-context learning potential of ChatGPT, we recursively generate an ExTensible Emotional Support dialogue dataset, named ExTES. Following this, we deploy advanced tuning techniques on the LLaMA model, examining the impact of diverse training strategies, ultimately yielding an LLM meticulously optimized for emotional support interactions. An exhaustive assessment of the resultant model showcases its proficiency in offering emotional support, marking a pivotal step in the realm of emotional support bots and paving the way for subsequent research and implementations.

研究动机与目标

  • 通过利用 LLMs 解决情感支持(ES)对话中的数据稀缺和培训挑战。
  • 创建一个大型、多样化的 ES 对话语料库(ExTES),包含情景和策略。
  • 评估多种参数高效微调技术在 LLaMA 上对 ES 聊天机器人的效果。
  • 评估数据集的毒性和跨数据集对 ESConv 与 ExTES 的泛化能力。
  • 提供对 ES 对话中策略分布和对话动态的见解。

提出的方法

  • 构建 36 个 ES 情景和 16 种 ES 策略来种子对话。
  • 从现有的 ES 数据集和网络来源手动整理 87 条种子对话。
  • 在自对话循环中使用 ChatGPT 生成约 11k 条 ES 对话(ExTES),以种子为引导。
  • 人工审核并纠正生成的对话以确保质量。
  • 使用参数高效方法(LoRA、Adapter)对 LLaMA-7B 家族模型进行微调,并与 DialoGPT 基线进行比较。
  • 使用自动指标(PPL、METEOR、BLEU/D、ROUGE、Extrema、D-1/2/3)和人工评估来评估;用 Perspective API 评估毒性;进行跨数据集测试(ExTES vs ESConv)。

实验结果

研究问题

  • RQ1各种参数高效微调策略(LoRA、Adapter)在 LLaMA 上对情感支持对话的效果如何?
  • RQ2ExTES 是否在 ES 领域具有泛化能力,并且在 ES 任务上优于 ESConv?
  • RQ3ExTES 生成数据的毒性水平如何,是否可以通过微调进一步降低?
  • RQ4数据集规模和策略引导生成如何影响质量和用户感知的支持?

主要发现

  • 在 LLaMA 上进行 LoRA-tuning 在大多数自动指标上优于其他主干模型(DialoGPT、Adapter),用于情感支持对话。
  • 以策略为引导的变体在某些方面有所提升(如有针对性的建议),但在其他方面可能降低多样性。
  • ExTES 在人类评估的质量(信息性、帮助性)方面与种子对话和 ESConv 在若干指标上相当甚至更好。
  • 跨数据集实验表明,在 ExTES 上训练的模型在 ESConv 测试集上表现良好,并且对未见情感支持场景的泛化能力优于在 ESConv 上训练的模型。
  • ExTES 的毒性分数较低,使用 LoRA 调优后进一步降低,表明情感支持互动更安全。
  • ExTES 展现出对情感支持应用的强泛化性,超出原始 ES 背景,有利于稳健的情感支持聊天机器人开发。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。