Skip to main content
QUICK REVIEW

[论文解读] MentSum: A Resource for Exploring Summarization of Mental Health Online Posts

Sajad Sotudeh, Nazli Goharian|arXiv (Cornell University)|Jun 2, 2022
Mental Health via Writing被引用 4
一句话总结

本文介绍了MentSum,一个包含超过24,000条与心理健康相关的Reddit帖子及其用户撰写的TL;DR摘要的大规模数据集,支持在线心理健康内容摘要研究。该研究评估了抽取式和生成式摘要模型,发现生成式模型(如BART)优于抽取式模型,且人工评估显示,系统生成的摘要在流畅性、信息量和简洁性方面平均优于用户撰写的摘要,尽管在捕捉推断性或细微信息方面仍存在挑战。

ABSTRACT

Mental health remains a significant challenge of public health worldwide. With increasing popularity of online platforms, many use the platforms to share their mental health conditions, express their feelings, and seek help from the community and counselors. Some of these platforms, such as Reachout, are dedicated forums where the users register to seek help. Others such as Reddit provide subreddits where the users publicly but anonymously post their mental health distress. Although posts are of varying length, it is beneficial to provide a short, but informative summary for fast processing by the counselors. To facilitate research in summarization of mental health online posts, we introduce Mental Health Summarization dataset, MentSum, containing over 24k carefully selected user posts from Reddit, along with their short user-written summary (called TLDR) in English from 43 mental health subreddits. This domain-specific dataset could be of interest not only for generating short summaries on Reddit, but also for generating summaries of posts on the dedicated mental health forums such as Reachout. We further evaluate both extractive and abstractive state-of-the-art summarization baselines in terms of Rouge scores, and finally conduct an in-depth human evaluation study of both user-written and system-generated summaries, highlighting challenges in this research.

研究动机与目标

  • 为解决缺乏针对心理健康相关社交媒体帖子摘要的领域特定数据集的问题,特别是为辅助咨询师快速分诊。
  • 创建一个高质量、保护隐私的Reddit帖子数据集,涵盖43个心理健康子版块,每篇帖子均配有简洁的用户生成TL;DR摘要。
  • 使用自动(ROUGE)和人工评估指标,在该新数据集上评估最先进的抽取式和生成式摘要模型。
  • 通过成对比较设置,对系统生成的摘要与用户撰写的TL;DR进行详细的人工评估,评估维度包括流畅性、信息量和简洁性。
  • 识别当前摘要模型在处理心理健康内容时的持续性挑战,如遗漏推断内容和过度依赖表面线索,以指导未来研究。

提出的方法

  • 从Reddit的43个公开心理健康子版块中精选超过24,000篇用户帖子,确保涵盖抑郁、焦虑和ADHD等各类心理状况的多样性。
  • 为每篇帖子收集用户撰写的TL;DR摘要(简短、自包含的摘要),作为摘要评估的黄金标准参考。
  • 使用ROUGE分数评估抽取式(如Lead-3、BERT-based)和生成式(如BART、T5)摘要模型的自动性能。
  • 在100组随机选取的帖子-摘要对上开展人工评估,采用成对比较设置,评估流畅性、信息量和简洁性。
  • 对系统生成的摘要进行错误分析,识别其失效模式,包括遗漏推断内容、重复以及过度或过少摘要。
  • 应用数据使用协议(DUA)以确保用户隐私和数据使用的伦理合规性,尽管原始帖子为公开内容。

实验结果

研究问题

  • RQ1抽取式和生成式摘要模型在Reddit心理健康帖子这一新领域特定数据集上的表现如何?
  • RQ2系统生成的摘要在流畅性、信息量和简洁性方面,与用户撰写的TL;DR相比,在多大程度上达到或超越其质量?
  • RQ3当前摘要模型在处理心理健康内容时,特别是在推断和细微信息方面,其主要失效模式是什么?
  • RQ4抽取式模型与理论最优上限(OracleExt)之间的性能差距,如何为心理健康文本抽取式摘要研究提供未来方向?
  • RQ5心理健康帖子的哪些特征——如弱首句偏倚或抽象性——对摘要模型构成独特挑战?

主要发现

  • 在所有评估模型中,生成式模型BART的ROUGE得分最高,优于抽取式基线模型。
  • 尽管是人工撰写,用户TL;DR在流畅性、信息量和简洁性方面平均仍不如系统生成的摘要受青睐。
  • 抽取式模型与OracleExt理论上限之间存在显著性能差距,表明该领域抽取式摘要仍有巨大改进空间。
  • 系统生成的摘要通常比用户撰写的TL;DR更完整地捕捉到所有诊断出的心理健康状况(如焦虑、GAD、广场恐惧症)。
  • 一个关键挑战是模型无法推断出某些用户TL;DR中存在但原文中未明确表达的细微、语境相关的隐含信息,如情感负担或社会影响。
  • 在某些情况下,用户撰写的TL;DR比系统生成的摘要更不简洁,表明模型能够有效压缩信息并保留关键要点。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。