Skip to main content
QUICK REVIEW

[论文解读] Towards Automated Real-time Evaluation in Text-based Counseling

Anqi Li, Jingsong Ma|arXiv (Cornell University)|Mar 7, 2022
Digital Mental Health Interventions被引用 4
一句话总结

本文提出了一种新型基准数据集,包含675份中文基于文本的心理咨询对话记录,采用细粒度编码方案(CRETCS)进行标注,以实现对咨询师-来访者互动质量的自动化实时评估。通过在无标签和有标签数据上进行多阶段预训练的BERT模型,作者在将来访者回应分类为如‘认可’、‘否定’和‘风险等级’等类别方面取得了实用性能,证明了机器学习在实时心理咨询质量监控中的可行性。

ABSTRACT

Automated real-time evaluation of counselor-client interaction is important for ensuring quality counseling but the rules are difficult to articulate. Recent advancements in machine learning methods show the possibility of learning such rules automatically. However, these methods often demand large scale and high quality counseling data, which are difficult to collect. To address this issue, we build an online counseling platform, which allows professional psychotherapists to provide free counseling services to those are in need. In exchange, we collect the counseling transcripts. Within a year of its operation, we manage to get one of the largest set of (675) transcripts of counseling sessions. To further leverage the valuable data we have, we label our dataset using both coarse- and fine-grained labels and use a set of pretraining techniques. In the end, we are able to achieve practically useful accuracy in both labeling system.

研究动机与目标

  • 为解决缺乏大规模、高质量数据集以实现对基于文本的心理咨询进行实时评估的问题。
  • 开发一种可靠的编码方案(CRETCS),以捕捉咨询过程中来访者回应和体验类型。
  • 探究先进的自然语言处理模型是否能在有限标注数据下实现对咨询师-来访者互动质量的自动化实时评估。
  • 探索有效的预训练策略,以提升在低资源心理咨询NLP任务中的模型性能。

提出的方法

  • 搭建了一个在线免费心理咨询平台,收集了675份来自专业咨询师使用认知行为疗法(CBT)、叙事疗法和心理动力学疗法的现实世界咨询对话记录。
  • 使用CRETCS编码方案对4,786个样本进行标注,该方案将来访者回应分类为粗粒度类别(如‘认可’、‘否定’)和细粒度类别(如‘安全’、‘可容忍风险’、‘不可容忍风险’)。
  • 采用两阶段预训练策略:首先在通用文本上进行预训练,然后在无标签咨询数据和小规模有标签数据集上进行微调,以使模型适应该领域。
  • 使用标注数据集对基于BERT的模型进行微调,以完成粗粒度和细粒度分类任务。
  • 开展广泛的消融实验和错误分析,以识别模型的失败模式,特别是因语言特征相似而导致的标签混淆(例如,‘yes’与‘not’在‘认可’与‘否定’之间的混淆)。

实验结果

研究问题

  • RQ1在仅使用有限标注数据的情况下,机器学习模型是否能在实时基于文本的心理咨询中实现对来访者回应的实用分类性能?
  • RQ2多阶段预训练(尤其是同时在无标签和有标签咨询数据上进行)在提升低资源治疗NLP任务中的模型性能方面有多有效?
  • RQ3模型的主要失败模式是什么?语言特征相似性(如‘yes’与‘not’)如何影响分类准确率?
  • RQ4数据不平衡以及缺乏干预策略知识在多大程度上影响模型在细粒度风险分类任务中的表现?

主要发现

  • 所提出的两阶段预训练策略显著提升了模型性能,第二阶段预训练在粗粒度和细粒度分类任务中均带来了可测量的性能提升。
  • 模型在‘否定’类别的F1得分为0.51,该类别最具挑战性,原因在于‘not’和‘no’等语言线索常被误分类为负面回应。
  • 模型在细粒度标签‘不感兴趣’(F1=0.26)和‘不可容忍风险’(F1=0.47)上表现最差,主要由于数据不平衡以及BERT输入中对话上下文有限。
  • ‘安全’与‘可容忍风险’之间的混淆较为常见,因为模型缺乏对咨询师干预策略的知识,导致尽管对话结构相似,仍出现误分类。
  • ‘其他’类别最容易分类,因其与其他类别在语义和结构特征上具有明显差异。
  • 尽管面临挑战,结果表明通过精心的数据整理和预训练,先进NLP方法可有效应用于心理咨询质量的实时评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。