[論文レビュー] MentaLLaMA: Interpretable Mental Health Analysis on Social Media with Large Language Models
論文は IMHI を紹介する。105k サンプルの多タスクデータセットを用いたソーシャルメディアの解釈可能なメンタルヘルス分析と、人間のような説明を生成する予測を提供するオープンソースの MentaLLaMA 指示追従型 LLM を訓練し、ほぼ最新の精度と強いタスク一般化を達成する。
With the development of web technology, social media texts are becoming a rich source for automatic mental health analysis. As traditional discriminative methods bear the problem of low interpretability, the recent large language models have been explored for interpretable mental health analysis on social media, which aims to provide detailed explanations along with predictions. The results show that ChatGPT can generate approaching-human explanations for its correct classifications. However, LLMs still achieve unsatisfactory classification performance in a zero-shot/few-shot manner. Domain-specific finetuning is an effective solution, but faces 2 challenges: 1) lack of high-quality training data. 2) no open-source LLMs for interpretable mental health analysis were released to lower the finetuning cost. To alleviate these problems, we build the first multi-task and multi-source interpretable mental health instruction (IMHI) dataset on social media, with 105K data samples. The raw social media data are collected from 10 existing sources covering 8 mental health analysis tasks. We use expert-written few-shot prompts and collected labels to prompt ChatGPT and obtain explanations from its responses. To ensure the reliability of the explanations, we perform strict automatic and human evaluations on the correctness, consistency, and quality of generated data. Based on the IMHI dataset and LLaMA2 foundation models, we train MentalLLaMA, the first open-source LLM series for interpretable mental health analysis with instruction-following capability. We also evaluate the performance of MentalLLaMA on the IMHI evaluation benchmark with 10 test sets, where their correctness for making predictions and the quality of explanations are examined. The results show that MentalLLaMA approaches state-of-the-art discriminative methods in correctness and generates high-quality explanations.
研究の動機と目的
- 解釈可能なメンタルヘルス分析を、予測と説明を生み出す生成タスクとして形式的に定義する。
- 解釈可能なメンタルヘルス分析のための、初の多タスク・多ソース指示チューニングデータセット IMHI を構築する。
- オープンソースの MentaLLaMA モデル(7B および 13B バリアント)を開発し、全体的なベンチマークで正確性と説明品質を評価する。
- 未見タスクへの強い一般化を実証し、識別的ベースラインおよびクローズド/オープン LLMs と比較する。
提案手法
- 10 ソースから収集した 8 つのメンタルヘルス課題に渡る入力-出力ペアを用いて生成ベースのタスクを形式化する。
- 生データの投稿、注釈、および ChatGPT 生成の説明を指示ベースの Q&A ペアに変換して IMHI データセットを構築する。
- 各注釈に対して高品質の説明を生成するために、ドメインプロンプトを用いた専門家設計の少数ショット説明を促す。
- 指示チューニングと RLHF により LLaMA2 ベースのモデル(7B および 13B)を微調整し、MentaLLaMA バリアント(チャット最適化版を含む)を構築する。
- IMHI ベンチマークを用いて、予測正確性の指標(重み付き F1)と説明品質の指標(BART-score)を MentalBERT ベースの整合性チェックで評価する。

実験結果
リサーチクエスチョン
- RQ1オープンソースの指示追従型 LLM は、識別的ベースラインと比較して解釈可能なメンタルヘルス分析でどれだけの性能を発揮するか?
- RQ2指示調整された LLaMA2 モデルは、人間の判断と一致する高品質な説明を生成するか?
- RQ3IMHI ベンチマーク内の未知のタスクに対して、MentaLLaMA モデルはどれだけよく一般化するか?
主な発見
- MentaLLaMA-chat-13B は、予測正確性の10 テストセット中7件で最先端の識別的手法に近づく。
- MentaLLaMA モデルは説明を ChatGPT と同等の水準で生成し、説明品質では生成系 PLM を上回る。
- 指示チューニングと RLHF、及びモデルサイズの増加は、全タスクにおいて正確性と説明品質を向上させる。
- IMHI データセットは未知のタスクへの強い一般化を実現し、いくつかの設定で ChatGPT より高い性能を示す。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。