Skip to main content
QUICK REVIEW

[論文レビュー] WellXplain: Wellness Concept Extraction and Classification in Reddit Posts for Mental Health Analysis

Muskan Garg|arXiv (Cornell University)|Aug 25, 2023
Mental Health via WritingPsychology被引用数 3
ひとこと要約

WellXplainは、Halbert L. Dunnの理論に基づく7つのウェルネス次元を3,092件のReddit投稿に対してアノテートした、画期的なデータセットを提供する。このデータセットは、概念抽出と説明可能な分類を用いて、細分化されたメンタルヘルススクリーニングを可能にする。本研究では、多様なモデルを用いたベースラインを確立し、ドメイン適応型トランスフォーマーおよび大規模言語モデル(LLM)が従来の分類器を上回ることを示した。また、人間がアノテートしたテキストスパンは、モデルの解釈可能性を向上させた。

ABSTRACT

During the current mental health crisis, the importance of identifying potential indicators of mental issues from social media content has surged. Overlooking the multifaceted nature of mental and social well-being can have detrimental effects on one's mental state. In traditional therapy sessions, professionals manually pinpoint the origins and outcomes of underlying mental challenges, a process both detailed and time-intensive. We introduce an approach to this intricate mental health analysis by framing the identification of wellness dimensions in Reddit content as a wellness concept extraction and categorization challenge. We've curated a unique dataset named WELLXPLAIN, comprising 3,092 entries and totaling 72,813 words. Drawing from Halbert L. Dunn's well-regarded wellness theory, our team formulated an annotation framework along with guidelines. This dataset also includes human-marked textual segments, offering clear reasoning for decisions made in the wellness concept categorization process. Our aim in publishing this dataset and analyzing initial benchmarks is to spearhead the creation of advanced language models tailored for healthcare-focused concept extraction and categorization.

研究の動機と目的

  • 症状中心の分析にとどまらない、ソーシャルメディアのテキストにおけるウェルネス次元の特定を通じて、多次元的メンタルヘルススクリーニングのギャップを埋める。
  • 文脈的で臨床的に根拠のあるウェルネス概念に基づき、早期のメンタル苦痛の兆候を検出する信頼性があり説明可能なフレームワークを構築する。
  • 明示的なテキストスパンを含む高品質で人間がアノテートしたデータセットを構築し、モデルの解釈可能性と臨床的妥当性の検証を支援する。
  • ユーザー生成コンテンツにおけるウェルネス次元の時間的変化を捉えることで、長期的なメンタルヘルスモニタリングを可能にする。
  • ドメイン特化型および大規模言語モデルを用いた、強固で説明可能なAIモデルの開発を促進する。

提案手法

  • Halbert L. Dunnのウェルネス理論に基づく7つのウェルネス次元をアノテートした、3,092件のReddit投稿と72,813語を含む新規データセット、WellXplainを構築する。
  • アノテーションの一貫性と臨床的妥当性を確保するため、詳細なアノテーションスキームとパープレキシティガイドラインを設計する。
  • 各ウェルネス概念の予測に対する説明として、人間がアノテートしたテキストスパンを収集し、モデルの解釈可能性を向上させ、人間を含む検証を支援する。
  • 伝統的なマルチクラス分類器、ドメイン適応型BERT変種、大規模言語モデル(LLM)を含む多様なモデルを、ウェルネス概念分類タスクで訓練および評価する。
  • アノテート済みスパンを補助的監視信号として用い、モデルの注目をテキスト内の関連する言語的手がかりに適切に向け、精度を向上させる。
  • 標準指標(例:F1スコア、正答率)を用いてモデル性能を評価し、モデルタイプ間での一般化性能を比較する。信頼性と解釈可能性に重点を置く。

実験結果

リサーチクエスチョン

  • RQ1症状中心のアプローチに比べ、多次元的ウェルネス概念抽出フレームワークは、ソーシャルメディアのテキストにおけるメンタルヘルス懸念の早期検出を改善できるか?
  • RQ2ドメイン適応型トランスフォーマーおよび大規模言語モデルは、従来の分類器と比較して、Reddit投稿におけるウェルネス次元分類でどの程度の性能を示すか?
  • RQ3人間がアノテートした説明スパンは、ウェルネス概念分類におけるモデル性能と解釈可能性をどの程度向上させるか?
  • RQ4モデルの予測は、異なるウェルネス次元において安定的で信頼性があるか?また、感情状態の微細な変化を時間的経過で検出するにあたり、主な課題は何か?
  • RQ5WellXplainデータセットは、ユーザー投稿における変化するウェルネス状態を捉えることで、長期的メンタルヘルス分析を可能にするか?

主な発見

  • ドメイン適応型トランスフォーマーおよび大規模言語モデルは、従来のマルチクラス分類器を上回り、微細なメンタルヘルス分析に適していることが示された。
  • 人間がアノテートした説明スパンの導入により、モデルの注目メカニズムと解釈可能性が顕著に向上し、予測に対する人間の検証と信頼性が強化された。
  • 強力な性能を示したにもかかわらず、モデルの予測は臨床的診断には不十分であり、人間の監視と倫理的ガードレールの必要性が浮き彫りになった。
  • データセットの分析から、感情的・社会的・スピリチュアルなウェルネスは、政治的・人的なストレス要因と連動して変化することが判明し、複雑なメンタルヘルスの経路を反映していた。
  • ユーザー投稿の縦断的分析から、ウェルネス次元の進行的悪化が観察された(例:T1で混乱 → T5で自殺念慮)。これは、時間的モニタリングの価値を示している。
  • WellXplainデータセットは、SDG 3に整合する包括的かつ多次元的なウェルネス評価を可能にするため、政策立案および臨床研究への応用の可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。