[論文レビュー] CAMS: An Annotated Corpus for Causal Analysis of Mental Health Issues in Social Media Posts
CAMS は Reddit 投稿におけるメンタルヘルスの解釈可能な因果分析のための公開注釈コーパスを導入し、直接的な原因を6つのカテゴリにラベル付けし、このタスクで分類器を評価します。ロジスティック回帰は精度で深層モデルを上回ります。
Research community has witnessed substantial growth in the detection of mental health issues and their associated reasons from analysis of social media. We introduce a new dataset for Causal Analysis of Mental health issues in Social media posts (CAMS). Our contributions for causal analysis are two-fold: causal interpretation and causal categorization. We introduce an annotation schema for this task of causal analysis. We demonstrate the efficacy of our schema on two different datasets: (i) crawling and annotating 3155 Reddit posts and (ii) re-annotating the publicly available SDCNL dataset of 1896 instances for interpretable causal analysis. We further combine these into the CAMS dataset and make this resource publicly available along with associated source code: https://github.com/drmuskangarg/CAMS. We present experimental results of models learned from CAMS dataset and demonstrate that a classic Logistic Regression model outperforms the next best (CNN-LSTM) model by 4.9\% accuracy.
研究の動機と目的
- ソーシャルメディア投稿におけるメンタルヘルスのための解釈可能な因果分析を定義する。
- メンタルヘルス問題の直接的な原因の注釈スキームとコーパスを作成する。
- Reddit データをクロールして注釈を付け、SDCNL データセットを再注釈して CAMS を形成する。
- 専門家レビューと Fleiss’ Kappa の一致度で注釈を検証する。
- CAMS 上の機械学習ベースラインを評価して因果分類の実現可能性を確立する。
提案手法
- 六分野の因果カテゴリー方式を提案する:理由なし、バイアス/虐待、職業/キャリア、薬物療法、関係、孤立。
- 臨床専門家の指導のもと、テキスト・原因・推論を含む投稿を注釈する。
- クロールした Reddit データ(最終3155件)と再注釈された SDCNL データ(SDCNL 訓練/テスト)を組み合わせて CAMS(総計5051件)を形成する。
- データセット間の信頼性を検証するため、アノテータ間の一致(Fleiss’ Kappa)を用いる。
- GloVe 100次元の埋め込みでテキストを前処理し複数の分類器を訓練する。
- LR、SVM、LSTM、CNN、GRU、Bi-LSTM、Bi-GRU、ハイブリッドを CAMS 指標(各クラスの F1 と精度)で評価する。
実験結果
リサーチクエスチョン
- RQ1公開注釈付きコーパスはソーシャルメディア投稿におけるメンタルヘルスの原因の解釈可能な分析を可能にするか?
- RQ2投稿におけるメンタルヘルス原因の6つのカテゴリーは何であり、人間はどれだけ信頼性を持って注釈できるか?
- RQ3伝統的なモデルと深層学習モデルは CAMS の因果分類をどの程度うまく行えるか?
- RQ4クロールデータの追加はクラスの均衡とモデル性能を改善するか?
- RQ5自動因果分類の共通の誤りパターンと制限は何か?
主な発見
- CAMS は六つの原因カテゴリーにわたる 5051 件の注釈対象を提供する。
- ロジスティック回帰はテストデータ CAMS で0.5013の全体精度で、試されたモデルの中で最高を達成した。
- CNN-LSTM(ハイブリッド)は、試された深層学習モデルの中で最良で、0.4778 の精度。
- 深層モデルは一般にこのタスクで LR を下回る傾向があり、クラスの重複とデータ特性が原因。
- モデル間では、孤立と人間関係の原因がより難しく、しばしば バイアス/虐待および薬物治療と混同される。
- CAMS に対するアノテータ間の一致は 61.28% であり、主観性を伴うタスクを考えると実質的には高い信頼性を示す。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。