[論文レビュー] PsyEval: A Suite of Mental Health Related Tasks for Evaluating Large Language Models
PsyEvalは、精神的健康分野における大規模言語モデル(LLM)を体系的に評価することを目的とした包括的なベンチマークであり、3つの次元——精神的健康知識、多疾患検出、共感的・安全な対話——の下に6つのサブタスクを有する。このベンチマークは、GPT-4が唯一、QAタスクで満足できる結果を達成している一方で、すべてのモデルが多疾患予測、共感理解、治療的対話における安全性の面で顕著な性能格差を示していることが明らかになった。
Evaluating Large Language Models (LLMs) in the mental health domain poses distinct challenged from other domains, given the subtle and highly subjective nature of symptoms that exhibit significant variability among individuals. This paper presents PsyEval, the first comprehensive suite of mental health-related tasks for evaluating LLMs. PsyEval encompasses five sub-tasks that evaluate three critical dimensions of mental health. This comprehensive framework is designed to thoroughly assess the unique challenges and intricacies of mental health-related tasks, making PsyEval a highly specialized and valuable tool for evaluating LLM performance in this domain. We evaluate twelve advanced LLMs using PsyEval. Experiment results not only demonstrate significant room for improvement in current LLMs concerning mental health but also unveil potential directions for future model optimization.
研究の動機と目的
- 精神的健康分野における大規模言語モデル(LLM)を評価するための包括的でないベンチマークの欠如に起因する、分野固有の課題に特化した体系的評価ツールの不足を是正すること。
- 精神的健康の微細な側面、たとえば症状の微妙な表現、共通疾患性、患者への共感、治療的会話における倫理的・安全基準を捉えるベンチマークを設計すること。
- 最先端のLLMが多様な精神的健康タスクにおいて果たすパフォーマンスを評価し、主な制限要因を同定し、今後のモデル開発を支援すること。
- モデルの信頼性と安全性を向上させるために、精神的健康に特化した言語および臨床的対話シナリオにおける専門的なトレーニングの必要性を強調すること。
- 精神的健康応用分野におけるLLMの継続的な研究開発を支援する、標準化され包括的な評価フレームワークを提供すること。
提案手法
- (1)精神的健康QA、(2)SNSからの多疾患検出、(3)模擬治療対話における共感的かつ安全な応答生成の3つの次元にわたり、合計6つのサブタスクを設計する。
- 各サブタスクに対して、回答のみ、Few-shot、Chain-of-Thoughtといった、推論力と生成能力を評価するためのタスク固有のプロンプトを明確に定義する。
- GPT-4、LLaMA、Vicunaなど、8つの最先端LLMを、すべてのサブタスクにおいて評価し、現在のモデルアーキテクチャを幅広くカバーする。
- 各タスクに対して標準化された評価指標(正確度、F1スコア、安全性/共感スコアなど)を採用し、信頼性の高い比較可能なパフォーマンス評価を実現する。
- 対話タスクにおける共感性と安全性の評価に、人間によるアノテーション基準を統合し、臨床的および倫理的基準と整合させる。
- アブレーションスタディおよび定性的分析を実施し、モデルの失敗モードや限界を特定する。特に、言語の曖昧さや自己認識と臨床的実態の乖離に関する課題に注目する。

実験結果
リサーチクエスチョン
- RQ1現在のLLMは、分野特化知識を要する精神的健康QAタスクにおいて、どの程度のパフォーマンスを示すか?
- RQ2LLMは、非公式で曖昧なSNS投稿から、複数の共存する精神的疾患をどの程度正確に検出できるか?
- RQ3LLMは、模擬的精神保健カウンセリング対話において、共感的かつ倫理的に安全な応答をどの程度効果的に生成できるか?
- RQ4LLMが精神的健康シナリオにおいて顕著な失敗モードを示す主な要因は何か。特に共感性、安全性、症状解釈の観点から。
- RQ5異なるプロンプト戦略(例:Few-shot、Chain-of-Thought)は、精神的健康タスクにおけるLLMのパフォーマンスにどの程度の影響を及えるか?
主な発見
- GPT-4以外のすべてのモデルが、精神的健康QAタスクで著しい分野知識の欠如を示しており、GPT-4が唯一、満足できるパフォーマンスを達成している。
- すべての評価対象モデルが、SNS投稿からの多疾患検出において顕著なパフォーマンス欠陥を示しており、言語の曖昧さや共通疾患性の処理に課題を抱えていることが明らかになった。
- 共感的応答生成においても、モデルは一貫して性能を発揮せず、患者の物語における感情的兆候を認識・適切に反応する能力が著しく制限されている。
- 安全性評価では、モデルが自殺念慮などの高リスクコンテンツを適切に検出または対応できないことが判明しており、模擬臨床対話において顕著な課題を示している。
- 精神的健康に特化した言語で微調整されていないモデルではパフォーマンスが著しく低下する傾向が観察された。これは、臨床的および患者中心の言語を対象とした専門的事前学習の必要性を示唆している。
- 本研究では、自己認識と臨床的診断との乖離をモデルが処理できないことが特定され、患者とセラピストの対話において、深い心理的推論能力の欠如が問題であることが示された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。