Skip to main content
QUICK REVIEW

[论文解读] WellXplain: Wellness Concept Extraction and Classification in Reddit Posts for Mental Health Analysis

Muskan Garg|arXiv (Cornell University)|Aug 25, 2023
Mental Health via WritingPsychology被引用 3
一句话总结

WellXplain 引入了一个新颖的数据集,包含 3,092 篇 Reddit 帖子,基于 Halbert L. Dunn 的理论对 7 个健康维度进行了标注,通过概念抽取和可解释分类,实现了细粒度的心理健康筛查。本研究使用多种模型建立了基线,表明领域自适应的变换器和大语言模型(LLMs)优于传统分类器,且人工标注的文本片段显著提升了模型的可解释性。

ABSTRACT

During the current mental health crisis, the importance of identifying potential indicators of mental issues from social media content has surged. Overlooking the multifaceted nature of mental and social well-being can have detrimental effects on one's mental state. In traditional therapy sessions, professionals manually pinpoint the origins and outcomes of underlying mental challenges, a process both detailed and time-intensive. We introduce an approach to this intricate mental health analysis by framing the identification of wellness dimensions in Reddit content as a wellness concept extraction and categorization challenge. We've curated a unique dataset named WELLXPLAIN, comprising 3,092 entries and totaling 72,813 words. Drawing from Halbert L. Dunn's well-regarded wellness theory, our team formulated an annotation framework along with guidelines. This dataset also includes human-marked textual segments, offering clear reasoning for decisions made in the wellness concept categorization process. Our aim in publishing this dataset and analyzing initial benchmarks is to spearhead the creation of advanced language models tailored for healthcare-focused concept extraction and categorization.

研究动机与目标

  • 通过在社交媒体文本中识别健康维度,弥合多维度心理健康筛查的空白,超越仅关注症状的分析方法。
  • 通过上下文化、临床依据充分的健康概念,建立可靠且可解释的框架,以检测心理困扰的早期迹象。
  • 创建高质量、人工标注的数据集,明确标注文本片段,以支持模型可解释性和临床验证。
  • 通过捕捉用户生成内容中健康维度随时间的变化,实现纵向心理健康监测。
  • 通过领域特定模型和大语言模型(LLMs),促进稳健且可解释的人工智能模型在心理健康应用中的发展。

提出的方法

  • 构建一个新的数据集 WellXplain,包含 3,092 篇 Reddit 帖子,共 72,813 个词,基于 Halbert L. Dunn 的健康理论对 7 个健康维度进行标注。
  • 设计详细的标注方案和困惑度指南,以确保标签的一致性和临床相关性。
  • 收集人工标注的文本片段作为每项健康概念预测的解释,以增强模型可解释性,并支持人机协同验证。
  • 在健康概念分类任务上,训练并评估多种模型,包括传统多分类分类器、领域自适应的 BERT 变体以及大语言模型(LLMs)。
  • 利用标注的文本片段作为辅助监督信号,引导模型注意力,提升对文本中相关语言线索的关注。
  • 使用标准指标(如 F1、准确率)评估模型性能,并比较不同模型类型在泛化能力方面的表现,强调可靠性与可解释性。

实验结果

研究问题

  • RQ1与仅关注症状的方法相比,多维度健康概念抽取框架是否能提升在社交媒体文本中对心理健康问题的早期检测能力?
  • RQ2在 Reddit 帖子中,领域自适应的变换器和大语言模型在分类健康维度方面,相较于传统分类器表现如何?
  • RQ3人工标注的解释性文本片段在健康概念分类中,对模型性能和可解释性的提升程度如何?
  • RQ4模型预测在不同健康维度上的稳定性和可靠性如何?检测幸福感细微变化的长期趋势面临哪些关键挑战?
  • RQ5WellXplain 数据集能否通过捕捉用户帖子中不断演变的健康状态,支持纵向心理健康分析?

主要发现

  • 领域自适应的变换器和大语言模型在分类健康维度方面优于传统多分类分类器,表明其在细致心理分析中的适用性。
  • 引入人工标注的解释性文本片段显著提升了模型注意力与可解释性,支持人工验证并增强对预测结果的信任。
  • 尽管性能表现良好,模型预测仍不足以用于临床诊断,凸显了人工监督与伦理保障的必要性。
  • 该数据集揭示,情绪、社交和精神健康等健康维度常与政治和人际关系压力源同步变化,反映出复杂多变的心理健康轨迹。
  • 对用户帖子的纵向分析显示,健康维度呈现渐进式恶化——例如从困惑(T1)发展至自杀意念(T5),凸显时间维度监测的价值。
  • WellXplain 数据集在政策与临床研究中具有潜力,可通过与可持续发展目标 3(SDG 3)一致的全面、多维的幸福感评估,推动整体福祉研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。