Skip to main content
QUICK REVIEW

[论文解读] Do Large Language Models Align with Core Mental Health Counseling Competencies?

Viet Cuong Nguyen, Mohammad Taher|arXiv (Cornell University)|Oct 29, 2024
Counseling Practices and SupervisionPsychology被引用 3
一句话总结

本文提出CounselingBench,一个基于NCMHCE的基准测试,用于评估22个大型语言模型(LLMs)在核心心理卫生咨询能力方面的表现。尽管前沿LLM在接诊、评估和诊断方面已超过最低能力阈值,但在以同理心为核心的能力(如核心咨询特质和专业实践与伦理)方面仍显著落后于专家,凸显了在实际部署前需进行专门微调和人工监督的必要性。

ABSTRACT

The rapid evolution of Large Language Models (LLMs) presents a promising solution to the global shortage of mental health professionals. However, their alignment with essential counseling competencies remains underexplored. We introduce CounselingBench, a novel NCMHCE-based benchmark evaluating 22 general-purpose and medical-finetuned LLMs across five key competencies. While frontier models surpass minimum aptitude thresholds, they fall short of expert-level performance, excelling in Intake, Assessment & Diagnosis but struggling with Core Counseling Attributes and Professional Practice & Ethics. Surprisingly, medical LLMs do not outperform generalist models in accuracy, though they provide slightly better justifications while making more context-related errors. These findings highlight the challenges of developing AI for mental health counseling, particularly in competencies requiring empathy and nuanced reasoning. Our results underscore the need for specialized, fine-tuned models aligned with core mental health counseling competencies and supported by human oversight before real-world deployment. Code and data associated with this manuscript can be found at: https://github.com/cuongnguyenx/CounselingBench

研究动机与目标

  • 通过评估LLM是否能支持临床实践,应对全球心理卫生专业人员日益短缺的问题。
  • 探究LLM是否与有效心理卫生护理所必需的核心咨询能力保持一致。
  • 识别LLM在同理心、伦理和文化敏感性等关键领域表现中的差距。
  • 开发一个标准化基准,用于评估LLM在心理卫生咨询情境中的表现。

提出的方法

  • 创建了基于NCMHCE的CounselingBench基准,包含1,619道多项选择题,覆盖五个咨询能力维度。
  • 评估了22个LLM(包括通用模型和医疗领域微调模型)在回答这些问题上的表现。
  • 将问题划分为五个能力类别:咨询技能与干预、接诊与评估、专业实践与伦理、治疗计划制定,以及核心咨询特质。
  • 采用人工标注标签进行评估,确保与既定临床标准一致。
  • 对比了不同模型类型(通用型与医疗领域微调型)的表现。
  • 分析错误类型与理由质量,以评估推理深度与情境相关性。

实验结果

研究问题

  • RQ1大型语言模型是否与执照标准所定义的核心心理卫生咨询能力保持一致?
  • RQ2通用型LLM与医疗领域微调LLM在关键咨询能力方面的表现有何差异?
  • RQ3LLM在同理心、伦理推理和以患者为中心的实践方面,达到专家水平的程度如何?
  • RQ4LLM在心理卫生咨询任务中,特别是在情境敏感性和价值导向领域,主要的失败模式是什么?
  • RQ5像CounselingBench这样的多项选择基准,能否可靠地作为心理卫生咨询实际临床能力的代理指标?

主要发现

  • 前沿LLM在接诊、评估与诊断方面表现优异,平均准确率超过80%,已超过最低能力阈值。
  • 尽管诊断表现强劲,LLM在核心咨询特质方面仍显著落后于专家,平均准确率低于50%。
  • 医疗领域微调LLM在准确率上并未优于通用模型,但其理由解释略具情境相关性。
  • LLM在情境相关错误上的表现多于通用模型,表明其更可能过度拟合训练数据模式,而非真正理解语境。
  • 在专业实践与伦理方面表现尤为薄弱,准确率低于60%,表明其对复杂情境中伦理决策的理解有限。
  • 该基准揭示,多项选择格式可能过度简化对同理心与复杂推理的评估,限制了其捕捉真实临床能力的能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。