[論文レビュー] Comparing the Efficacy of GPT-4 and Chat-GPT in Mental Health Care: A Blind Assessment of Large Language Models for Psychological Support
本研究では、臨床医が盲検で実施した評価を通じて、GPT-4とChatGPTが、うつ病、不安、トラウマ、関連疾患を含む18の心理的プロンプトに対してどのように反応するかを比較した。GPT-4はChatGPTを著しく上回り、平均臨床評価得点が10点中8.29点であったのに対し、ChatGPTは6.52点であった。これは、共感性、臨床的関連性、治療的ガイダンスの面で優れていることを示している。
Background: Rapid advancements in natural language processing have led to the development of large language models with the potential to revolutionize mental health care. These models have shown promise in assisting clinicians and providing support to individuals experiencing various psychological challenges. Objective: This study aims to compare the performance of two large language models, GPT-4 and Chat-GPT, in responding to a set of 18 psychological prompts, to assess their potential applicability in mental health care settings. Methods: A blind methodology was employed, with a clinical psychologist evaluating the models' responses without knowledge of their origins. The prompts encompassed a diverse range of mental health topics, including depression, anxiety, and trauma, to ensure a comprehensive assessment. Results: The results demonstrated a significant difference in performance between the two models (p > 0.05). GPT-4 achieved an average rating of 8.29 out of 10, while Chat-GPT received an average rating of 6.52. The clinical psychologist's evaluation suggested that GPT-4 was more effective at generating clinically relevant and empathetic responses, thereby providing better support and guidance to potential users. Conclusions: This study contributes to the growing body of literature on the applicability of large language models in mental health care settings. The findings underscore the importance of continued research and development in the field to optimize these models for clinical use. Further investigation is necessary to understand the specific factors underlying the performance differences between the two models and to explore their generalizability across various populations and mental health conditions.
研究の動機と目的
- 資格を有する心理学者による盲検評価を通じて、GPT-4とChatGPTの心理的支援における臨床的有効性を評価すること。
- 抑うつ、不安、トラウマ、感情の制御など、多様な精神的健康分野をカバーする2つの大規模言語モデルの反応の質を比較すること。
- LLMが、精神的健康ケアの場面に適した、臨床的に関連性があり、共感的で目標指向の反応を提供できるかどうかを評価すること。
- 性能の差異と安全性に関する懸念事項を特定することで、LLMを精神的支援分野に倫理的に統合する手がかりを提供すること。
提案手法
- 盲検評価設計が採用され、臨床心理学者がモデルの出力元を知らない状態で反応を評価した。
- 18の標準化された心理的プロンプトが使用され、不安、抑うつ、自己肯定感、ストレス、人間関係の問題など、主要な分野をカバーした。
- 臨床的関連性、共感性、治療的正確性、目標指向性に基づき、10点満点のスケールで反応が評価された。
- GPT-4とChatGPTの平均反応得点を比較する統計的分析が実施され、p < 0.05が有意とされた。
- 言語的トーン、感情的反応性、臨床的妥当性の質的および定量的評価に焦点を当てた。

実験結果
リサーチクエスチョン
- RQ1GPT-4とChatGPTは、心理的プロンプトに対して、どの程度共感的かつ臨床的に関連性のある反応を提供できるか?
- RQ2抑うつ、不安、トラウマの症状に対処するにあたり、どちらのモデルがより強い治療的整合性を示すか?
- RQ3臨床的監視なしに、LLMがどの程度目標指向の心理的介入を支援できるか?
- RQ42つのモデルの間で、応答構造、感情的トーン、臨床的有用性に顕著な質的差異は何か?
主な発見
- GPT-4の平均臨床評価得点は10点中8.29点であり、ChatGPTの6.52点よりも顕著に高く(p < 0.05)、有意であった。
- GPT-4は共感性に優れており、ユーザーの苦痛に寄り添った、より思いやりのある反応が評価された。
- GPT-4は、うつ病、不安、強迫性障害(OCD)などの疾患管理に役立つ、より臨床的に正確で実行可能な戦略を提供した。
- ChatGPTの反応は、より単純で、ときには安全性に欠け、明確な治療的方針が欠落していると評価された。
- 臨床心理学者は、GPT-4の言語的トーンが、治療的アライアンスを築くのにより効果的であると判断した。
- 性能の差は、トラウマ、ADHD、社会不安障害に関連するプロンプトを含む、多様なプロンプトにおいて一貫していた。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。