[論文レビュー] ChatCounselor: A Large Language Models for Mental Health Support
ChatCounselor は専門的なカウンセリングデータ (Psych8k) でファインチューニングされた LLM で、メンタルヘルス支援を提供し、オープンソースモデルを上回り、ChatGPT の性能に近づく。
This paper presents ChatCounselor, a large language model (LLM) solution designed to provide mental health support. Unlike generic chatbots, ChatCounselor is distinguished by its foundation in real conversations between consulting clients and professional psychologists, enabling it to possess specialized knowledge and counseling skills in the field of psychology. The training dataset, Psych8k, was constructed from 260 in-depth interviews, each spanning an hour. To assess the quality of counseling responses, the counseling Bench was devised. Leveraging GPT-4 and meticulously crafted prompts based on seven metrics of psychological counseling assessment, the model underwent evaluation using a set of real-world counseling questions. Impressively, ChatCounselor surpasses existing open-source models in the counseling Bench and approaches the performance level of ChatGPT, showcasing the remarkable enhancement in model capability attained through high-quality domain-specific data.
研究の動機と目的
- 認定カウンセラーから高品質なカウンセリングデータセット (Psych8k) を構築する。
- 心理カウンセリング向けのドメイン特化型指示チューニングパイプラインを開発する。
- 専用の Counseling Bench と GPT-4 の自動評価を用いてカウンセリングの質を評価する。
- ドメイン特化データがオープンソースのベースラインより性能を向上させることを実証する。
- 本研究を再現・拡張するためのコードを公開する。
提案手法
- 実務カウンセリングインタビュー260件から Psych8k を組み立て、GPT-4 を用いて約200万トークンに及ぶ8,187の指示ペアを蒸留する。
- カウンセリングタスク向けのドメイン特化指示で LLaMA-7B 基盤モデルをファインチューニングする。
- 自回帰トレーニングを用いた指示チューニングで応答をカウンセリングスキルに沿わせる。
- 七つの戦略に基づく Counseling Bench と実世界の質問229件を用いて評価する。
- 戦略横断でモデル出力を評価する自動採点者として GPT-4 を活用する。
- コンテキスト長、バッチサイズ、最適化アルゴリズム、ハードウェアを含むトレーニング設定の詳細を報告する。
実験結果
リサーチクエスチョン
- RQ1ドメイン特化型のカウンセリングデータはメンタルヘルス支援におけるLLMの性能を向上させるか?
- RQ2ChatCounselor はオープンソースのベースラインと比較して、ドメイン関連のカウンセリング戦略でどう性能を示すか?
- RQ3少量の高品質な専門データがカウンセリングの質に測定可能な向上をもたらすか?
- RQ4自動化された GPT-4 評価はカウンセリング能力を堅牢かつ迅速に評価できるか?
主な発見
- ChatCounselor は Counseling Bench において、open-source LLaMA-7B、Alpaca-7B、ChatGLM-v2-7B、Robins-v2-7B を上回る。
- 自動評価では ChatGPT の性能に近い。
- カウンセリング特化データでのファインチューニングは、基本モデルおよび汎用指示チューニング系を超える改善をもたらす。
- 比較的小規模で高品質なデータセット(Psych8k)は、ドメイン特化のカウンセリング性能を大幅に高める可能性がある。
- GPT-4 ベースの自動評価は手動評価を補完し、迅速なベンチマークを支援する。
- この手法は、専門的対話システムにおける実務プロフェッショナルデータの価値を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。