Skip to main content
QUICK REVIEW

[论文解读] Towards Automated Psychotherapy via Language Modeling

Houjun Liu|arXiv (Cornell University)|Apr 5, 2021
Mental Health via Writing被引用 5
一句话总结

本研究提出了一种微调后的基于Transformer的自然语言模型,通过从Cornell电影对话语料库和较小的开源心理治疗数据集进行迁移学习,实现对心理治疗师与患者文本对话的自动化。该模型在响应质量指数上的表现达到人类水平的案例占59.7%,在类似图灵测试的'识Bot'评估中,有67.16%的案例表现匹配或超过人类水平,表明其在减轻污名化和减轻临床工作负荷方面具有强大潜力。

ABSTRACT

In this experiment, a model was devised, trained, and evaluated to automate psychotherapist/client text conversations through the use of state-of-the-art, Seq2Seq Transformer-based Natural Language Generation (NLG) systems. Through training the model upon a mix of the Cornell Movie Dialogue Corpus for language understanding and an open-source, anonymized, and public licensed psychotherapeutic dataset, the model achieved statistically significant performance in published, standardized qualitative benchmarks against human-written validation data - meeting or exceeding human-written responses' performance in 59.7% and 67.1% of the test set for two independent test methods respectively. Although the model cannot replace the work of psychotherapists entirely, its ability to synthesize human-appearing utterances for the majority of the test set serves as a promising step towards communizing and easing stigma at the psychotherapeutic point-of-care.

研究动机与目标

  • 开发一种基于最先进自然语言生成技术的自动化、低污名化、按需心理治疗回应系统。
  • 通过利用通用对话语料库的迁移学习,解决高质量、公开可用的心理治疗对话数据稀缺的问题。
  • 使用标准化的人工编码质量指标和图灵式评估,对比模型生成回应与人工撰写回应的表现。
  • 探索使用神经语言模型在真实世界心理健康支持中实现规模化应用的可行性,特别是在资源匮乏的环境中。

提出的方法

  • 采用两阶段训练流程,对基于序列到序列的Transformer语言模型进行微调:首先在Cornell电影对话语料库上进行预训练,随后在较小的、已匿名化的心理治疗数据集上继续训练。
  • 采用‘逐滴注入’式数据输入机制,逐步混合通用对话数据与心理治疗专用数据,以稳定训练过程并提升领域适应能力。
  • 采用改进的编码器-解码器架构,结合自注意力机制,以捕捉治疗师与患者交流中的上下文依赖关系。
  • 应用响应质量指数(RQI)对生成回应的流畅性、共情能力和临床相关性进行定量评估,与人工撰写的标准答案进行对比。
  • 开展‘识Bot’图灵评估,以盲测方式由人工评分者区分模型生成输出与人类输出,评估生成回应的人类相似度。
  • 使用混合数据集训练模型至收敛,并在保留的134组人工撰写提示-回应对测试集上进行评估。

实验结果

研究问题

  • RQ1微调后的基于Transformer的自然语言模型能否生成在质量与自然度上与人工撰写回应无法区分的心理治疗回应?
  • RQ2从通用对话语料库进行迁移学习,在低资源心理治疗对话生成任务中,能在多大程度上提升模型性能?
  • RQ3该模型在标准化人工编码指标(如响应质量指数,RQI)上的回应质量,与人类回应相比如何?
  • RQ4在盲测图灵式评估中,有多少比例的模型生成回应被评定为与人类水平相当或更优?
  • RQ5该模型在心理治疗语境下,生成具有同理心、上下文相关且临床相关的回应方面,具备怎样的泛化能力?

主要发现

  • 根据响应质量指数(RQI)评估,该模型在59.7%的测试案例中达到或超过人类水平的回应质量。
  • 在‘识Bot’图灵评估中,该模型在67.16%的测试集中表现匹配或超过人类水平,表明其具有极强的人类相似度。
  • 在人类回应优于模型的案例中,仅有17.9%显示出统计显著差异(p < 0.05),表明在大多数情况下性能差距极小。
  • 在20.9%的案例中,模型被正确识别为机器生成,表明近五分之一的回应被评分者认为非人类。
  • 该模型在多轮对话中仍能维持连贯且上下文相关的交流,即使在马尔可夫假设下亦然,如对话示例所示。
  • 从Cornell电影对话语料库进行迁移学习,显著提升了模型在心理治疗领域生成流畅、富有同理心且上下文恰当回应的能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。