Skip to main content
QUICK REVIEW

[论文解读] Can We Assess Mental Health through Social Media and Smart Devices? Addressing Bias in Methodology and Evaluation

Adam Tsakalidis, Maria Liakata|arXiv (Cornell University)|Jul 19, 2018
Mental Health via Writing参考文献 20被引用 6
一句话总结

本文通过社交媒体和智能手机数据评估心理健康预测模型在现实世界中的可行性,表明当前最先进方法在实际、合理的评估设置下无法泛化——尤其是在留一用户交叉验证(LOUOCV)和留一实例交叉验证(LOIOCV)中,其表现甚至不如多数投票或用户特定平均值等简单基线模型,暴露出当前方法论和评估实践中的关键缺陷。

ABSTRACT

Predicting mental health from smartphone and social media data on a longitudinal basis has recently attracted great interest, with very promising results being reported across many studies. Such approaches have the potential to revolutionise mental health assessment, if their development and evaluation follows a real world deployment setting. In this work we take a closer look at state-of-the-art approaches, using different mental health datasets and indicators, different feature sources and multiple simulations, in order to assess their ability to generalise. We demonstrate that under a pragmatic evaluation framework, none of the approaches deliver or even approach the reported performances. In fact, we show that current state-of-the-art approaches can barely outperform the most naïve baselines in the real-world setting, posing serious questions not only about their deployment ability, but also about the contribution of the derived features for the mental health assessment task and how to make better use of such data in the future.

研究动机与目标

  • 探究基于数字表型数据的心理健康预测最先进模型在真实世界部署场景中是否具备有效的泛化能力。
  • 揭示当前评估实践中存在的方法论缺陷,特别是对混合交叉验证(MIXED)的过度依赖,该方法会人为夸大性能指标。
  • 基于留一用户交叉验证(LOUOCV)和留一实例交叉验证(LOIOCV)提出更真实的评估框架,以衡量模型的真实泛化能力。
  • 挑战在无偏、实际条件下测试时,社交媒体和智能手机传感器特征是否真正有助于心理健康预测的假设。
  • 提出一种新的、严格的评估与模型构建框架,以指导未来数字心理健康评估研究。

提出的方法

  • 在两个纵向数据集上开展实验,涵盖四种不同的心理健康目标(如幸福感、抑郁),使用多样化的特征来源(文本、传感器数据、应用使用情况)。
  • 应用标准的最先进评估协议(MIXED交叉验证)以复现先前表现优异的结果。
  • 在现实、实际的设置下重新评估模型:采用留一用户交叉验证(LOUOCV)和留一实例交叉验证(LOIOCV),这些设置更贴近真实世界部署。
  • 将模型性能与多种简单基线进行比较,包括多数投票、随机预测、基于用户身份的模型以及用户特定平均值。
  • 采用时间与用户级别的独立性约束,确保评估的可靠性,避免时间与个体之间的数据泄露。
  • 提出未来方向,包括在潜在特征表示上应用迁移学习以及改进特征工程,以增强在LOUOCV和LOIOCV设置下的泛化能力。

实验结果

研究问题

  • RQ1在现实的LOUOCV评估框架下,最先进心理健康预测模型在未见过的用户上泛化能力如何?
  • RQ2通过LOIOCV训练的个性化模型能否在预测未来心理健康状态时优于简单基线(如最后一次输入的情绪评分或用户平均值)?
  • RQ3为何在MIXED交叉验证中表现优异的模型在实际、真实世界环境中无法泛化?
  • RQ4在无偏、现实条件下评估时,来自社交媒体和智能手机传感器的特征在心理健康预测中起到何种作用?
  • RQ5未来研究应如何设计评估框架,以防止过拟合并确保可靠、可部署的心理健康预测系统?

主要发现

  • 在实用评估框架(LOUOCV和LOIOCV)下,最先进模型的表现甚至无法超越最基础的基线,如多数投票或用户特定平均值。
  • 当模型在未见过的用户或实例上进行评估时,性能显著下降,表明先前MIXED交叉验证设置中存在严重过拟合。
  • MIXED评估设置在以往研究中被广泛使用,但会导致结果过于乐观,无法保证模型在真实世界部署中的性能。
  • LOIOCV中训练与测试实例之间的时间依赖关系导致性能估计过于乐观,违反了独立同分布(i.i.d.)假设,从而削弱了泛化能力的宣称。
  • 在现实条件下评估时,用户生成特征(如文本、传感器数据)对心理健康预测的贡献与随机噪声无异。
  • 即使使用复杂的特征工程和深度学习技术训练的模型,也无法超越其特定用户或时间窗口的泛化能力,凸显了当前方法论的根本局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。