Skip to main content
QUICK REVIEW

[论文解读] PsyEval: A Suite of Mental Health Related Tasks for Evaluating Large Language Models

Haoan Jin, Siyuan Chen|arXiv (Cornell University)|Nov 15, 2023
Mental Health via Writing被引用 5
一句话总结

PsyEval 是一个全面的基准测试,涵盖三个维度——心理健康知识、多病种检测和共情/安全对话——旨在系统评估大语言模型(LLMs)在心理健康领域的表现。该基准揭示了显著的性能差距,其中只有 GPT-4 在问答任务中达到可接受的结果,而所有模型在多病种预测、共情理解以及治疗对话的安全性方面均表现不佳。

ABSTRACT

Evaluating Large Language Models (LLMs) in the mental health domain poses distinct challenged from other domains, given the subtle and highly subjective nature of symptoms that exhibit significant variability among individuals. This paper presents PsyEval, the first comprehensive suite of mental health-related tasks for evaluating LLMs. PsyEval encompasses five sub-tasks that evaluate three critical dimensions of mental health. This comprehensive framework is designed to thoroughly assess the unique challenges and intricacies of mental health-related tasks, making PsyEval a highly specialized and valuable tool for evaluating LLM performance in this domain. We evaluate twelve advanced LLMs using PsyEval. Experiment results not only demonstrate significant room for improvement in current LLMs concerning mental health but also unveil potential directions for future model optimization.

研究动机与目标

  • 为解决当前缺乏针对心理健康领域独特挑战的系统性评估工具,填补大语言模型(LLMs)在心理健康领域全面基准测试的空白。
  • 设计一个能够捕捉心理健康领域细微特征的基准,包括症状的隐晦表达、共病现象、患者共情能力以及治疗对话中的伦理安全性。
  • 在多样化心理健康任务中评估最先进 LLM 的表现,识别关键局限性,并为未来模型开发提供指导。
  • 强调需要针对心理健康特定语言和临床对话场景进行专门训练,以提升模型的可靠性与安全性。
  • 提供一个标准化、整体化的评估框架,支持 LLM 在心理健康应用领域的持续研究与开发。

提出的方法

  • 设计六个子任务,覆盖三个维度:(1) 心理健康问答(QA),(2) 从社交媒体文本中检测多病种,(3) 在模拟治疗对话中生成共情且安全的回应。
  • 为每个子任务设计简洁、任务特定的提示,包括仅答案、少样本和思维链等提示策略,以评估模型的推理与生成能力。
  • 在所有子任务中选取并评估八种最先进 LLM,包括 GPT-4、LLaMA、Vicuna 等,确保覆盖当前主流模型架构。
  • 为每项任务采用标准化评估指标,包括准确率、F1 分数以及安全性和共情评分,确保性能评估的可靠与可比性。
  • 在对话任务中引入人工标注的评估标准,用于共情与安全性,确保与临床和伦理标准一致。
  • 开展消融研究与定性分析,识别模型的失败模式与局限性,尤其关注语言模糊性处理以及自我感知与临床现实之间的差异。
Figure 1: Overview diagram of PsyEval
Figure 1: Overview diagram of PsyEval

实验结果

研究问题

  • RQ1当前 LLM 在需要领域特定知识的心理健康问答任务中表现如何?
  • RQ2LLM 在多病种共现的非正式、模糊社交媒体文本中,多大程度上能准确检测出多种心理障碍?
  • RQ3LLM 在模拟心理健康咨询对话中,多大程度上能有效生成共情且合乎伦理的安全回应?
  • RQ4LLM 在心理健康场景中的关键失败模式是什么,特别是在共情、安全性以及症状解读方面?
  • RQ5不同提示策略(如少样本、思维链)如何影响 LLM 在心理健康任务中的表现?

主要发现

  • 只有 GPT-4 在心理健康问答任务中达到令人满意的表现,表明其他 LLM 在领域知识方面存在显著差距。
  • 所有评估模型在从社交媒体帖子中检测多种共病心理障碍方面均表现出显著性能缺陷,凸显其在处理语言模糊性与共病现象方面的挑战。
  • 模型在生成共情回应方面持续表现不佳,对患者叙述中的情感线索识别与响应能力有限。
  • 安全评估显示,模型在模拟临床对话中常无法识别或适当地回应高风险内容(如自杀意念)。
  • 当模型未在心理健康特定语言上进行微调时,性能明显下降,表明需要针对临床与以患者为中心的语言进行专门预训练。
  • 本研究发现,模型在处理自我感知与临床诊断之间心理健康状态差异方面存在困难,表明其在患者-治疗师互动中缺乏深层次的心理推理能力。
Figure 2: Prompt for Mental health Question-Answering
Figure 2: Prompt for Mental health Question-Answering

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。