Skip to main content
QUICK REVIEW

[论文解读] Toward Large Language Models as a Therapeutic Tool: Comparing Prompting Techniques to Improve GPT-Delivered Problem-Solving Therapy

Daniil Filienko, Yinzhou Wang|PubMed|Aug 27, 2024
Artificial Intelligence in Healthcare and EducationMedicine参考文献 1被引用 3
一句话总结

本研究评估了提示工程技巧在提升GPT-4提供家庭照护者心理治疗(PST)能力方面的作用,采用少样本示例和思维链(Chain-of-Thought)提示技术进行上下文学习。研究发现,少样本提示显著提升了症状识别与目标设定能力,而思维链提示虽增强了共情能力,却降低了任务准确性,表明提示设计对大语言模型在心理治疗对话中的表现具有决定性影响。

ABSTRACT

While Large Language Models (LLMs) are being quickly adapted to many domains, including healthcare, their strengths and pitfalls remain under-explored. In our study, we examine the effects of prompt engineering to guide Large Language Models (LLMs) in delivering parts of a Problem-Solving Therapy (PST) session via text, particularly during the symptom identification and assessment phase for personalized goal setting. We present evaluation results of the models' performances by automatic metrics and experienced medical professionals. We demonstrate that the models' capability to deliver protocolized therapy can be improved with the proper use of prompt engineering methods, albeit with limitations. To our knowledge, this study is among the first to assess the effects of various prompting techniques in enhancing a generalist model's ability to deliver psychotherapy, focusing on overall quality, consistency, and empathy. Exploring LLMs' potential in delivering psychotherapy holds promise with the current shortage of mental health professionals amid significant needs, enhancing the potential utility of AI-based and AI-enhanced care services.

研究动机与目标

  • 评估提示工程是否能在不进行微调的情况下,提升通用大语言模型在无监督协议化心理治疗(PST)中的表现能力。
  • 评估不同提示技术(零样本、少样本、思维链)对大语言模型生成PST对话的质量、一致性和共情能力的影响。
  • 通过专家评估与自动化指标,将模型生成的对话与人类治疗师基线进行对比。
  • 探讨即用型大语言模型在心理健康护理中作为治疗工具的可行性,尤其针对治疗师资源短缺的问题。
  • 识别在不进行模型微调的前提下,哪种提示策略最能平衡治疗质量、任务准确率与共情响应能力。

提出的方法

  • 将现有的用于医学问答的大语言模型流程改编为生成PST对话,重点聚焦于症状识别与目标设定。
  • 通过少样本提示采用上下文学习,向模型提供示例对话以引导其响应风格与结构。
  • 应用思维链(CoT)提示,以鼓励分步推理,旨在提升响应中的共情与探索深度。
  • 使用标准化患者扮演者模拟一致、基于角色的互动,确保评估条件可复现。
  • 实施双重评估:自动化指标用于评估连贯性与结构,专家人工评分用于评估共情、质量与一致性。
  • 将模型输出与基于规则的聊天机器人基线进行对比,后者仅使用通用共情短语,而非基于证据的治疗技术。

实验结果

研究问题

  • RQ1不同提示技术(零样本、少样本、思维链)如何影响大语言模型生成的心理治疗对话的质量与一致性?
  • RQ2少样本提示在多大程度上提升了大语言模型在PST会话中症状识别与目标设定的准确性?
  • RQ3思维链提示是否增强了大语言模型响应中的共情能力?若增强,是否以牺牲任务特定性能为代价?
  • RQ4在受控的、由专家评估的环境中,大语言模型的表现与人类治疗师基线相比如何?
  • RQ5在不进行模型微调的前提下,提示工程在实现协议化、以患者为中心的心理治疗方面存在哪些局限性?

主要发现

  • 与零样本提示相比,少样本提示显著提升了大语言模型在症状识别与目标设定方面的能力。
  • 思维链提示提升了感知到的共情能力,尤其是在治疗的探索阶段,但降低了症状识别与目标设定的准确性。
  • 专家对模型生成的对话整体质量评分高于人类创建的基线,后者仅使用通用共情短语,而非基于证据的治疗技术。
  • 尽管有所改进,模型在隐含治疗原则方面仍存在困难,例如倾向于提供行动导向的建议,而非过度乐观或泛泛的回应。
  • 结果表明,提示工程可显著提升大语言模型在治疗应用中的表现,但共情与任务准确率之间的权衡需通过精心设计来解决。
  • 本研究突显了大语言模型若未得到充分保护,存在复述个人隐私信息的风险,强调未来工作需加强隐私保护型微调与检索增强生成技术。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。