[論文レビュー] Understanding the Therapeutic Relationship between Counselors and Clients in Online Text-based Counseling using LLMs
本論文は、包括的なガイドラインとChain-of-Thoughtプロンプティングを用いて、LLMの出力を人間の専門家評価と一致させる、オンラインテキストベースのカウンセリングにおける作業同盟の自動評価フレームワークを提案する。このアプローチは人間の評価と高い一致を示し、LLMが精神保健カウンセリングにおける監視ツールとして機能する可能性を示している。
Robust therapeutic relationships between counselors and clients are fundamental to counseling effectiveness. The assessment of therapeutic alliance is well-established in traditional face-to-face therapy but may not directly translate to text-based settings. With millions of individuals seeking support through online text-based counseling, understanding the relationship in such contexts is crucial. In this paper, we present an automatic approach using large language models (LLMs) to understand the development of therapeutic alliance in text-based counseling. We adapt a theoretically grounded framework specifically to the context of online text-based counseling and develop comprehensive guidelines for characterizing the alliance. We collect a comprehensive counseling dataset and conduct multiple expert evaluations on a subset based on this framework. Our LLM-based approach, combined with guidelines and simultaneous extraction of supportive evidence underlying its predictions, demonstrates effectiveness in identifying the therapeutic alliance. Through further LLM-based evaluations on additional conversations, our findings underscore the challenges counselors face in cultivating strong online relationships with clients. Furthermore, we demonstrate the potential of LLM-based feedback mechanisms to enhance counselors' ability to build relationships, supported by a small-scale proof-of-concept.
研究の動機と目的
- オンライン精神保健カウンセリングにおける手動評価の高コストさと主観性を是正すること。
- 中立的でスケーラブルな第三者評価手法として、作業同盟の自動評価を構築すること。
- 専門家が設計したガイドラインとChain-of-Thoughtプロンプティングを用いて、LLMのカウンセリング品質評価性能を向上させること。
- 人間がアノテートしたデータと比較してLLMベースの評価を検証し、その信頼性と解釈可能性を評価すること。
- LLMが臨床研修および監視における監視ツールとしての可能性を検討すること。
提案手法
- 著者らは、オンラインプラットフォームから大規模なテキストベースのカウンセリングデータセットを収集し、カウンセラーとクライアントの両方が自己報告した作業同盟スコアを含んだ。
- ボリンの治療的関係理論に基づき、作業同盟インventary(WAI)のオブザーバー版を開発し、各構成要素(目的、タスク、結束)に対して4つの詳細な質問を設けた。
- 専門家アノテーターが、5段階(明確な反証証拠あり、やや反証証拠あり、反証証拠なし、やや支持証拠あり、明確な支持証拠あり)の根拠に基づく評価をセッションの一部に適用した。
- GPT-4などのLLMを、これらのガイドラインを用いて微調整し、複数ターンの会話全体における作業同盟評価の正確性を向上させた。
- 解釈可能性と一貫性を向上させるために、Chain-of-Thought(CoT)プロンプティングを統合し、会話から根拠を抽出・正当化する能力を強化した。
- 人間のアノテーションとの比較による検証を通じて、フレームワークは高い一致を示し、LLMが抽出した根拠を用いることでアノテーションの一貫性が向上した。
実験結果
リサーチクエスチョン
- RQ1専門家が設計したガイドラインによって、LLMがオンラインカウンセリングにおける作業同盟を信頼性の高い方法で評価できるか。
- RQ2Chain-of-Thoughtプロンプティングは、LLMベースのカウンセリング評価の解釈可能性と正確性をどのように向上させるか。
- RQ3LLMベースの評価は、人間の専門家による治療的結束評価とどの程度一致するか。
- RQ4LLMが抽出した根拠は、カウンセリング評価における人間のアノテーションの一貫性と質を向上させることができるか。
- RQ5LLMが精神保健カウンセリングの研修および品質保証における監視ツールとしての可能性はどの程度か。
主な発見
- LLMベースの評価手法は、人間の専門家評価と高い一致を示し、作業同盟の評価において強い信頼性と妥当性を示した。
- 専門家が設計したガイドラインの統合により、GPT-4のカウンセリングセッション評価性能が顕著に向上し、内部的一致性と人間の判断との整合性が確保された。
- Chain-of-Thoughtプロンプティングにより、LLMは会話から支援根拠を特定・抽出する能力を発揮し、スコアの解釈可能性と正当性が向上した。
- LLMが抽出した根拠は、人間のアノテーター間の一貫性を向上させた。これは、LLMが人間の評価プロセスにおいて貴重な支援ツールとして機能できることを示唆している。
- 本アプローチは、従来の手動評価に代わるコスト効率が高く、スケーラブルで中立的な代替手段を提供し、臨床的監視および研修分野での応用が強く期待される。
- 本研究は、LLMが関係的ダイナミクス(特に作業同盟)を含むカウンセリング品質の自動的・第三者的評価に効果的に活用可能であることを確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。