Skip to main content
QUICK REVIEW

[论文解读] SMILE: Single-turn to Multi-turn Inclusive Language Expansion via ChatGPT for Mental Health Support

Huachuan Qiu, Hongliang He|arXiv (Cornell University)|Apr 30, 2023
Mental Health via Writing被引用 6
一句话总结

本文提出SMILE方法,利用ChatGPT将单轮次心理健康问答转化为多样化、真实的多轮对话,构建了SmileChat数据集。该方法通过生成大规模、保护隐私且主题多样的对话,使训练更高效、更具情感支持性的对话系统成为可能,这些对话高度模拟真实生活互动。

ABSTRACT

Developing specialized dialogue systems for mental health support requires multi-turn conversation data, which has recently garnered increasing attention. However, gathering and releasing large-scale, real-life multi-turn conversations that could facilitate advancements in mental health support presents challenges in data privacy protection and the time and cost involved in crowdsourcing. To address these challenges, we introduce SMILE, a single-turn to multi-turn inclusive language expansion technique that prompts ChatGPT to rewrite public single-turn dialogues into multi-turn ones. Our work begins by analyzing language transformation and validating the feasibility of our proposed method. We conduct a study on dialogue diversity, including lexical features, semantic features, and dialogue topics, demonstrating the effectiveness of our method. Further, we employ our method to generate a large-scale, lifelike, and diverse dialogue dataset named SMILECHAT, consisting of 55k dialogues. Finally, we utilize the collected corpus to develop a mental health chatbot, MeChat. To better assess the quality of SMILECHAT, we collect a small-scale real-life counseling dataset conducted by data anonymization. Both automatic and human evaluations demonstrate significant improvements in our dialogue system and confirm that SMILECHAT is high-quality. Code, data, and model are publicly available at https://github.com/qiuhuachuan/smile.

研究动机与目标

  • 解决大规模、高质量且保护隐私的多轮次心理健康对话数据集稀缺的问题。
  • 开发一种可扩展且包容的方法,从公开的单轮次问答中生成多样化、贴近真实生活的多轮对话。
  • 验证使用类似ChatGPT的大型语言模型增强心理健康对话数据的有效性,同时保持语义和词汇丰富性。
  • 构建SmileChat数据集,作为训练和评估心理健康支持对话智能体的基准。
  • 利用生成的多轮对话数据提升现有开源聊天模型的对话能力。

提出的方法

  • SMILE方法使用微调后的提示词,指导ChatGPT(gpt-3.5-turbo)将单轮问答对改写为模拟自然、富有同理心对话的多轮对话。
  • 提示词设计旨在保留原始意图,融入情感支持,并以自然对话流形式包含建设性建议。
  • 通过多次生成时提示不同主题、情感基调和响应结构,确保生成结果的多样性。
  • 对使用SMILE与未使用SMILE生成的数据集进行系统性对比分析,以评估对话多样性、语义丰富度和真实性。
  • 通过将SMILE方法应用于公开的单轮次心理健康问答,构建了大规模、多轮次的对话数据集SmileChat。
  • 通过定性与定量分析(包括自动指标和人工评估)对方法进行评估,以验证生成对话的真实性与多样性。

实验结果

研究问题

  • RQ1大型语言模型如ChatGPT能否有效将单轮次心理健康问答转化为保留情感与语义深度的真实感多轮对话?
  • RQ2与现有数据集相比,SMILE生成的数据集在主题多样性、词汇丰富度和对话真实性方面表现如何?
  • RQ3使用SmileChat数据集在多大程度上提升了心理健康对话系统在提供情感支持和建设性反馈方面的性能?
  • RQ4生成对话的哪些关键特征使其与真实生活中的心理健康对话高度相似?
  • RQ5与单轮数据相比,多轮结构的引入在多大程度上提升了对话智能体的训练效果?

主要发现

  • SMILE方法成功生成了一个大规模、多样化且真实感强的多轮心理健康对话数据集SmileChat,涵盖多样的对话主题、词汇特征和语义深度。
  • 通过与未增强数据的系统性对比分析,验证了生成对话具有高度真实感和情感连贯性。
  • 与单轮或基线增强方法相比,SmileChat数据集在对话多样性与语义丰富度方面表现出显著提升。
  • 使用SmileChat进行微调后,对话模型在多轮交互中提供情感支持和建设性建议的能力得到显著增强。
  • 该方法通过将公开问答转化为新对话,有效保护了隐私,未暴露任何敏感个人信息。
  • 该方法具有可扩展性和成本效益,可在无需人工标注或从真实用户收集数据的情况下,生成高质量的心理健康对话数据。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。