Skip to main content
QUICK REVIEW

[論文レビュー] MentSum: A Resource for Exploring Summarization of Mental Health Online Posts

Sajad Sotudeh, Nazli Goharian|arXiv (Cornell University)|Jun 2, 2022
Mental Health via Writing被引用数 4
ひとこと要約

本稿では、24,000件を超えるメンタルヘルス関連のReddit投稿と、ユーザーが作成したTL;DR要約をペairedした大規模データセットMentSumを紹介する。このデータセットは、オンラインメンタルヘルスコンテンツの要約に関する研究を可能にする。研究では、抽出的要約モデルと生成的要約モデルの評価が行われ、生成的モデル(例:BART)が抽出的モデルを上回ることを確認した。また、人間による評価では、系統的要約がユーザーが作成した要約よりも、流暢さ、情報量、要約度において平均的に好まれることがわかったが、推論やニュアンスのある情報の捕捉に課題が残っている。

ABSTRACT

Mental health remains a significant challenge of public health worldwide. With increasing popularity of online platforms, many use the platforms to share their mental health conditions, express their feelings, and seek help from the community and counselors. Some of these platforms, such as Reachout, are dedicated forums where the users register to seek help. Others such as Reddit provide subreddits where the users publicly but anonymously post their mental health distress. Although posts are of varying length, it is beneficial to provide a short, but informative summary for fast processing by the counselors. To facilitate research in summarization of mental health online posts, we introduce Mental Health Summarization dataset, MentSum, containing over 24k carefully selected user posts from Reddit, along with their short user-written summary (called TLDR) in English from 43 mental health subreddits. This domain-specific dataset could be of interest not only for generating short summaries on Reddit, but also for generating summaries of posts on the dedicated mental health forums such as Reachout. We further evaluate both extractive and abstractive state-of-the-art summarization baselines in terms of Rouge scores, and finally conduct an in-depth human evaluation study of both user-written and system-generated summaries, highlighting challenges in this research.

研究の動機と目的

  • メンタルヘルス関連のソーシャルメディア投稿の要約に特化したデータセットの不足に対処し、特にカウンセラーによる迅速なスクリーニングを支援すること。
  • 43のメンタルヘルス関連サブレdditから得た、高品質でプライバシー保護が施されたReddit投稿データセットを構築し、それぞれに要約度の高いユーザー生成TL;DR要約をペアリングすること。
  • 自動評価(ROUGE)と人間評価の両方を用いて、最新の抽出的および生成的要約モデルを、この新しいデータセット上で評価すること。
  • 系統的要約とユーザーが作成したTL;DRとの間で、流暢さ、情報量、要約度の観点から詳細な人間評価を実施すること。
  • 現在の要約モデルが、推論やニュアンスに関する情報の欠落、表面的特徴への過剰依存といった、継続的な課題を特定し、今後の研究を支援すること。

提案手法

  • Redditの43の公的メンタルヘルス関連サブレdditから、うつ病、不安、ADHDなど多様な疾患をカバーする24,000件以上のユーザー投稿を収集した。
  • 各投稿に対して、ユーザーが作成したTL;DR要約(短く、自己完結的な要約)を収集し、要約評価のゴールドスタンダードとしての役割を果たした。
  • ROUGEスコアを用いて、抽出的(例:Lead-3、BERTベース)および生成的(例:BART、T5)要約モデルの自動性能を評価した。
  • 100件のランダムに選択された投稿-要約ペアについて、一対比較評価の設定を用いて、流暢さ、情報量、要約度を人間評価で評価した。
  • 系統的要約の誤り分析を実施し、推論された内容の欠落、繰り返し、過剰または不十分な要約といった失敗モードを同定した。
  • 公開された投稿であるが、ユーザーのプライバシーと倫理的データ利用を確保するため、データ使用契約(DUA)を適用した。

実験結果

リサーチクエスチョン

  • RQ1抽出的および生成的要約モデルは、Redditのメンタルヘルス関連投稿という新しいドメイン固有のデータセット上で、どのように性能を発揮するか?
  • RQ2系統的要約は、流暢さ、情報量、要約度の観点から、ユーザーが作成したTL;DRに比べて、どの程度優れているか?
  • RQ3現在の要約モデルが、推論やニュアンスに関する情報に関して、メンタルヘルスコンテンツの要約において、どのような主な失敗モードを示しているか?
  • RQ4抽出的モデルと理論的上限(OracleExt)との性能差は、メンタルヘルステキストの抽出的要約分野における今後の研究に、どのように示唆をもたらすか?
  • RQ5弱いリードバイアスや抽象的特徴といった、メンタルヘルス投稿の特性が、要約モデルにどのような独自の課題をもたらすか?

主な発見

  • 生成的モデルBARTが、評価された全モデルの中で最高のROUGEスコアを記録し、抽出的ベースラインを上回った。
  • 人間が作成したTL;DRでさえも、系統的要約が流暢さ、情報量、要約度の平均的な好みで上回られた。
  • 抽出的モデルは、OracleExtの理論的上限から顕著な性能差を示しており、この分野における抽出的要約の改善余地が大きいことが示された。
  • 系統的要約は、一部のユーザーが作成したTL;DRよりも、診断済みのメンタルヘルス状態(例:不安、GAD、社会不安障害)をより包括的に捉えていた。
  • 主な課題として、ユーザーのTL;DRに存在するが、元の投稿に明示されていない感情的負担や社会的影響といった、文脈的に暗黙の情報の推論が、モデルで困難であることがわかった。
  • 一部の事例では、ユーザーが作成したTL;DRが系統的要約よりも不恰好であったため、モデルが重要なポイントを保持しながら効果的に情報を圧縮できている可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。