[论文解读] Hashtag Healthcare: From Tweets to Mental Health Journals Using Deep Transfer Learning
本文提出使用深度迁移学习,将基于公开Twitter数据训练的情感效价预测模型迁移至私人心理健康日记中,证明尽管数据量小且受隐私限制,社交媒体数据仍能显著提升心理健康情感分析的准确性和鲁棒性。关键结果表明,从Twitter到心理健康日记的迁移学习可将误差降低高达25%,并证实了公众与私人自我表达在情感语言上的语义差距较小。
As the popularity of social media platforms continues to rise, an ever-increasing amount of human communication and self- expression takes place online. Most recent research has focused on mining social media for public user opinion about external entities such as product reviews or sentiment towards political news. However, less attention has been paid to analyzing users' internalized thoughts and emotions from a mental health perspective. In this paper, we quantify the semantic difference between public Tweets and private mental health journals used in online cognitive behavioral therapy. We will use deep transfer learning techniques for analyzing the semantic gap between the two domains. We show that for the task of emotional valence prediction, social media can be successfully harnessed to create more accurate, robust, and personalized mental health models. Our results suggest that the semantic gap between public and private self-expression is small, and that utilizing the abundance of available social media is one way to overcome the small sample sizes of mental health data, which are commonly limited by availability and privacy concerns.
研究动机与目标
- 通过利用公开可用的社会媒体文本进行训练,以解决心理健康数据标注稀缺的问题。
- 探究公共社交媒体语言是否能有效迁移到私人心理健康日记分析中。
- 通过迁移学习提高认知行为疗法中情感效价预测的准确性和个性化水平。
- 评估公众自我表达(Twitter)与私人心理健康日记之间语义相似性。
- 开发一种可扩展的自动化工具,用于在线心理健康治疗平台的实时反馈。
提出的方法
- 微调在大规模Twitter数据集上预训练并标注情感效价的深度神经网络,以分类心理健康日记条目。
- 使用迁移学习将社交媒体领域学习到的词表示和上下文嵌入迁移到心理健康领域。
- 采用多分类框架,包含四种效价类别:积极、消极、两者兼具、两者皆无。
- 应用注意力机制以解释模型预测,并识别日记条目中显著的情感关键词。
- 使用交叉熵损失和Adam优化进行模型训练,并采用早停法防止过拟合。
- 使用F1-macro和加权F1分数在未见的心理健康测试集上评估性能。
实验结果
研究问题
- RQ1深度迁移学习能否有效弥合公众社交媒体与私人心理健康日记之间的情感语义差距?
- RQ2在Twitter数据上进行预训练在多大程度上提升了心理健康日记中的效价预测准确率?
- RQ3注意力机制如何突出心理健康叙述中的情感显著词汇?
- RQ4公众与私人情感表达之间的语义相似性是否足够高,足以证明在心理健康应用中迁移学习的合理性?
- RQ5迁移学习模型能否检测患者叙述中随时间变化的细微情感变化?
主要发现
- 与在有限心理健康数据上从零开始训练相比,从Twitter到心理健康日记的迁移学习将误差率降低了高达25%。
- 表现最佳的模型在心理健康测试集上取得了0.78的加权F1分数,表现出强大的泛化能力。
- 与焦虑、担忧和痛苦相关的词汇获得了最高的注意力权重,证实了模型聚焦于临床相关的感情线索。
- 该模型成功识别出患者叙述中情感波动和改善的模式,支持临床反馈应用。
- 公众与私人情感表达之间的语义差距足够小,可实现有效的情感效价预测迁移学习。
- 注意力机制揭示,'worried'(担忧)、'anxious'(焦虑)、'stressed'(压力大)、'overwhelmed'(不堪重负)等术语始终与负面效价预测相关。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。