[论文解读] SoulChat: Improving LLMs' Empathy, Listening, and Comfort Abilities through Fine-tuning with Multi-turn Empathy Conversations
本文提出SoulChat,一个大规模中文多轮共情对话数据集,包含超过230万个样本,通过使用以人类为中心的提示微调大语言模型,增强其共情、倾听与安慰能力。在SoulChatCorpus上进行微调显著提升了大语言模型在情感支持场景下的表现,在自动评估与人工评估中均优于基线模型。
Large language models (LLMs) have been widely applied in various fields due to their excellent capability for memorizing knowledge and chain of thought (CoT). When these language models are applied in the field of psychological counseling, they often rush to provide universal advice. However, when users seek psychological support, they need to gain empathy, trust, understanding and comfort, rather than just reasonable advice. To this end, we constructed a multi-turn empathetic conversation dataset of more than 2 million samples, in which the input is the multi-turn conversation context, and the target is empathetic responses that cover expressions such as questioning, comfort, recognition, listening, trust, emotional support, etc. Experiments have shown that the empathy ability of LLMs can be significantly enhanced when finetuning by using multi-turn dialogue history and responses that are closer to the expression of a psychological consultant.
研究动机与目标
- 为解决在心理健康应用中微调大语言模型时缺乏大规模、多轮、聚焦共情的中文对话数据集的问题。
- 提升大语言模型提供共情回应的能力,如倾听、安慰、认可与情感支持,而非提供通用建议。
- 通过利用多轮对话模式与共情约束,构建一个更贴近心理辅导员行为的人性化大语言模型。
- 通过数据外包、基于规则的清洗与人工标注优化,创建一个可扩展且保护隐私的数据集。
- 通过自动指标与专家标注的人工评估,检验在共情特定回应上微调的有效性。
提出的方法
- 首先收集了619,725个单轮心理咨询服务回复与215,813个问题,涵盖12个主题,构建了包含230万个样本的多轮共情对话数据集SoulChatCorpus。
- 应用强化的中文共情约束提示微调基于GPT的模型,强调表达倾听、安慰、信任、认可与情感支持等元素。
- 使用ChatGPT将单轮对话转换为多轮共情对话,随后通过基于规则的过滤与人工校对,进一步提升共情表达质量。
- 由三位心理学专家参与人工评估,使用3分制(0–2)对响应的自然性、共情度、帮助性与安全性进行评分,并在安全性方面达成完全一致(κ=1)。
- 在SoulChatCorpus上微调基础模型ChatGLM-6B,并使用BLEU、ROUGE以及在SoulChatCorpus与SMILECHAT测试集上的人工标注评估性能。
- 采用严格的数据显示清洗流程,包括移除敏感内容(如“suicide”、“I am”)与105,134个有害样本,确保伦理合规性。
实验结果
研究问题
- RQ1在大规模、多轮、中文共情对话数据集上微调大语言模型,是否能显著提升其提供共情性、以倾听为导向与具有安慰作用回应的能力?
- RQ2所提出的共情约束提示与现有提示(如SMILE)相比,在增强大语言模型生成回应中的共情表达方面表现如何?
- RQ3SoulChatCorpus数据集在多大程度上提升了其他共情基准(如SMILECHAT)上的零样本性能?
- RQ4人工标注评估与自动指标在评估大语言模型生成的心理咨询回应中的共情度与安全性方面有何差异?
- RQ5生成用户个性化共情回应时存在哪些主要局限?未来模型应如何考虑用户属性(如年龄、性别与人格特征)?
主要发现
- 在SoulChatCorpus与SMILECHAT测试集上,SoulChat在所有自动评估指标(BLEU-1至BLEU-4,ROUGE-1至ROUGE-L)上均优于ChatGLM-6B、ChatGPT与MeChat。
- 在人工评估中,SoulChat在0–2量表上的平均共情度得分为1.78,显著高于基线模型,表明其共情回应生成能力更强。
- 模型在共情度、帮助性与自然性方面表现出中等到高度的评分者间一致性(Fleiss’ κ = 0.489–0.532),在安全性方面达成完全一致(κ=1)。
- 该数据集达到230万个样本规模,是首个达到百万量级的中文心理健康与情感支持多轮共情对话数据集。
- SoulChat在SMILECHAT基准上展现出强大的零样本泛化能力,表明微调后的表征具有良好的迁移性,可应用于其他共情导向任务。
- 安全性评估确认,所有潜在有害内容均在数据清洗阶段被清除,最终模型在人工评估中也保持了高安全性得分。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。