[论文解读] An Assessment on Comprehending Mental Health through Large Language Models
本研究评估了大型语言模型(LLMs),如 Llama-2 和 ChatGPT,在使用 DAIC-WOZ 数据集进行心理健康症状检测时的表现,与经典 Transformer 模型(例如 Distil-RoBERTa、BERT)进行对比。尽管参数规模庞大,LLMs 的表现仍逊于微调过的较小 Transformer 模型,在 GAD 和 PHQ 问题集上的精确率、召回率和 F1 分数方面,Distil-RoBERTa 表现最佳。
Mental health challenges pose considerable global burdens on individuals and communities. Recent data indicates that more than 20% of adults may encounter at least one mental disorder in their lifetime. On the one hand, the advancements in large language models have facilitated diverse applications, yet a significant research gap persists in understanding and enhancing the potential of large language models within the domain of mental health. On the other hand, across various applications, an outstanding question involves the capacity of large language models to comprehend expressions of human mental health conditions in natural language. This study presents an initial evaluation of large language models in addressing this gap. Due to this, we compare the performance of Llama-2 and ChatGPT with classical Machine as well as Deep learning models. Our results on the DAIC-WOZ dataset show that transformer-based models, like BERT or XLNet, outperform the large language models.
研究动机与目标
- 评估大型语言模型(LLMs)如 Llama-2 和 ChatGPT 在理解与检测自然语言中心理健康状况方面的能力。
- 将 LLMs 与经典机器学习和深度学习模型(尤其是微调过的 Transformer 架构)在心理健康症状检测中的表现进行比较。
- 探究提示工程策略是否能提升 LLMs 在心理健康问题集(GAD-1、GAD-2、PHQ-1、PHQ-2)上的表现。
- 识别 LLMs 在应用于敏感心理健康数据时存在的关键性能差距与偏见,尤其考虑到误诊或有害建议的高风险。
- 为未来心理健康领域 AI 工具的发展提供实证基准,强调模型适配与偏见缓解的必要性。
提出的方法
- 在 DAIC-WOZ 数据集上,对微调过的 Transformer 模型(包括 BERT、RoBERTa、XLNet 和 Distil-RoBERTa)进行训练与评估,用于心理健康症状检测。
- 采用多种策略(如少样本提示、零样本提示)对大型语言模型 Llama-2 和 ChatGPT 进行提示,以从临床对话转录本中分类症状。
- 使用标准 NLP 指标评估模型性能:加权精确率、召回率、F1 分数、汉明损失和 AUC-ROC,用于多标签分类任务。
- XGBoost 作为强基线模型,用于与深度学习和 LLM 方法进行比较,利用人工特征工程与梯度提升技术。
- 本研究采用零样本与少样本提示框架评估 LLMs,考察其在心理健康症状检测任务上的少样本泛化能力。
- 所有模型均在四个心理健康问题集上进行评估:GAD-1、GAD-2(广泛性焦虑障碍)、PHQ-1 和 PHQ-2(抑郁症状),以 PHQ-4 量表为参考。
实验结果
研究问题
- RQ1在未进行微调的情况下,Llama-2 和 ChatGPT 等大型语言模型能否有效从临床对话转录本中检测心理健康症状?
- RQ2LLMs 在心理健康症状检测任务中的表现与微调过的较小 Transformer 模型(如 Distil-RoBERTa、BERT)相比如何?
- RQ3与标准微调相比,提示工程策略是否能显著提升 LLMs 在心理健康分类任务中的表现?
- RQ4在多标签心理健康预测任务中,XGBoost 和深度学习模型与 LLMs 在汉明损失和 AUC-ROC 指标上的相对表现如何?
- RQ5LLMs 在检测焦虑与抑郁症状方面表现出多大程度的偏见或不一致性,尤其是在心理健康数据高度敏感的背景下?
主要发现
- Distil-RoBERTa 在 GAD-2 问题集上取得了最高的加权 F1 分数 0.68,在 PHQ-2 上为 0.62,优于包括 Llama-2 和 ChatGPT 在内的所有其他模型。
- ChatGPT 3.5 在 PHQ-2 上表现出微弱优势,F1 分数为 0.53(Llama-2 为 0.49),且在 GAD-2 上 AUC-ROC 更高(0.77 vs. 0.70)。
- Llama-2(v3)在所有指标上表现均较差,GAD-2 上加权 F1 仅为 0.33,PHQ-2 上为 0.30,表明其在心理健康任务上的零样本泛化能力有限。
- XGBoost 在汉明损失方面始终优于所有模型,在 GAD-2 上为 0.31,在 PHQ-2 上为 0.47,显示出在多标签分类任务中的强大性能。
- 基于 Transformer 的模型(如 BERT、XLNet 和 RoBERTa)在所有指标上显著优于 LLMs,其中 Distil-RoBERTa 在性能与效率之间实现了最佳平衡。
- 本研究发现,LLMs 的更大参数量并不能转化为心理健康症状检测中的更好表现,这挑战了 LLMs 在临床 NLP 中具备更强泛化能力的既有假设。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。