[論文レビュー] Supervised Learning and Large Language Model Benchmarks on Mental Health Datasets: Cognitive Distortions and Suicidal Risks in Chinese Social Media
本稿では、認知的歪みおよび自殺リスク分類のための2つの新しい専門家アノテート済み中国語ソーシャルメディアデータセットを紹介し、ゼロショット、フェイシング、ファインチューニング戦略を用いた、教師あり学習と大規模言語モデル(LLMs)であるGPT-3.5およびGPT-4の比較評価を実施する。GPT-4は一貫して他のモデルを上回る性能を示したが、GPT-3.5の自殺リスク分類における性能はファインチューニングによって顕著に向上し、LLMsの潜在的価値と同時に、洗練された心理的テキスト分析における限界も浮き彫りにした。
On social media, users often express their personal feelings, which may exhibit cognitive distortions or even suicidal tendencies on certain specific topics. Early recognition of these signs is critical for effective psychological intervention. In this paper, we introduce two novel datasets from Chinese social media: SOS-HL-1K for suicidal risk classification and SocialCD-3K for cognitive distortions detection. The SOS-HL-1K dataset contained 1,249 posts and SocialCD-3K dataset was a multi-label classification dataset that containing 3,407 posts. We propose a comprehensive evaluation using two supervised learning methods and eight large language models (LLMs) on the proposed datasets. From the prompt engineering perspective, we experimented with two types of prompt strategies, including four zero-shot and five few-shot strategies. We also evaluated the performance of the LLMs after fine-tuning on the proposed tasks. The experimental results show that there is still a huge gap between LLMs relying only on prompt engineering and supervised learning. In the suicide classification task, this gap is 6.95% points in F1-score, while in the cognitive distortion task, the gap is even more pronounced, reaching 31.53% points in F1-score. However, after fine-tuning, this difference is significantly reduced. In the suicide and cognitive distortion classification tasks, the gap decreases to 4.31% and 3.14%, respectively. This research highlights the potential of LLMs in psychological contexts, but supervised learning remains necessary for more challenging tasks. All datasets and code are made available.
研究の動機と目的
- 中国語ソーシャルメディアにおける細分化されたメンタルヘルスNLPリソースの不足に応えること、特に認知的歪みおよび自殺リスクの分野に焦点を当てる。
- これらの新規データセットを用いて、教師あり学習と大規模言語モデル(LLMs)の相対的有効性を評価すること。
- プロンプト工学戦略(ゼロショット、フェイシング、ファインチューニング)が、心理的テキスト分類におけるLLMのパフォーマンスに与える影響を調査すること。
- LLMがメンタルヘルス文脈における微妙な感情的サインを認識する際の強みと限界について、心理的洞察を提供すること。
- 今後の研究を支援するため、オープンソースのデータセットとコードをリリースすること。
提案手法
- Sina Weiboのコメントから、認知的歪みおよび自殺リスク分類に焦点を当てた、2つの新しい専門家アノテート済みデータセットを構築した。
- ゼロショット、フェイシング、ファインチューニングの3つのプロンプト戦略を用いて、教師あり学習モデルとLLMs(GPT-3.5、GPT-4、ChatGLM2-6B、GLM-130B)を比較する包括的なベンチマークを設計した。
- LLMsの評価では、ゼロショットは直接的なプロンプトテンプレートを、フェイシングは少数のラベル付き例をデモンストレーションとして用い、ファインチューニングは全訓練セットを用いて実施した。
- 標準的なNLP指標(F1スコア、適合率、再現率)を用いてモデルのパフォーマンスを評価し、統計的有意性の検定も実施した。
- 臨床的認識における認知的歪みおよび自殺傾向の理解と整合性があるかを検証するため、モデル予測の心理的解釈を実施した。
- すべてのデータセットとコードをGitHub経由でリリースし、再現可能性とコミュニティによる再利用を確保した。

実験結果
リサーチクエスチョン
- RQ1大規模言語モデル(LLMs)は、教師あり学習モデルと比較して、中国語ソーシャルメディアのテキストにおける認知的歪みおよび自殺リスク分類において、どの程度のパフォーマンスを示すか?
- RQ2ファインチューニングは、複雑なまたは微妙な感情的サインを含むメンタルヘルス分類タスクにおいて、LLMsのパフォーマンスを向上させるか?
- RQ3タスク固有のファインチューニングなしで、LLMsがメンタルヘルステキストに一般化できるようにするためのゼロショットおよびフェイシングプロンプト戦略は、どの程度有効か?
- RQ4LLMsは、メンタルヘルス関連言語における微妙な感情的ニュアンスを区別する際に、どのような心理的限界を示すか?
- RQ5モデルサイズおよびアーキテクチャは、これらの心理的に敏感なNLPタスクにおけるパフォーマンスにどの程度影響を与えるか?
主な発見
- GPT-4は、認知的歪みおよび自殺リスク分類の両タスクにおいて一貫した優れたパフォーマンスを示し、他のモデルを上回った。
- GPT-3.5はファインチューニングを経て自殺リスク分類において顕著な改善を示した。これは、ファインチューニングが特定のメンタルヘルスタスクにおいてパフォーマンスを顕著に向上させられることを示唆している。
- フェイシングプロンプトは一貫したパフォーマンス向上をもたらさず、単にプロンプトに例を追加するだけでは、複雑な心理的分類タスクにおいて十分ではないことが示唆された。
- 教師あり学習とLLMsの間には顕著なパフォーマンス格差が残っており、特に細分化された認知的歪み検出において顕著で、LLMsがまだ万能な代替手段とは言えないことを示している。
- モデルのパフォーマンスはタスクの複雑さとモデルサイズに強く依存しており、GPT-4のような大規模モデルは微妙な言語的サインに対してより高い耐性を示した。
- 本研究は、LLMsが有望ではあるが、特に区別が微妙な状況では、洗練された心理的状態を正確に捉えることが難しいことが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。