Skip to main content
QUICK REVIEW

[論文レビュー] Can AI Relate: Testing Large Language Model Response for Mental Health Support

Saadia Gabriel, Isha Puri|arXiv (Cornell University)|May 20, 2024
Mental Health via Writing被引用数 4
ひとこと要約

本研究では、GPT-4 などの大規模言語モデル(LLM)の精神的健康対応の公平性と質を、臨床医による評価とバイアス監査を用いて、人間のペア支援と比較して評価した。GPT-4 は黒人利用者に対して2%〜15%低い共感性を示す統計的に有意な共感性格差を示したが、明示的な人種的属性のプロンプトを用いることでこのバイアスを軽減できることが判明した。これは、倫理的なガイドラインに従えばLLMが精神的健康ケアを支援できる可能性を示している。

ABSTRACT

Large language models (LLMs) are already being piloted for clinical use in hospital systems like NYU Langone, Dana-Farber and the NHS. A proposed deployment use case is psychotherapy, where a LLM-powered chatbot can treat a patient undergoing a mental health crisis. Deployment of LLMs for mental health response could hypothetically broaden access to psychotherapy and provide new possibilities for personalizing care. However, recent high-profile failures, like damaging dieting advice offered by the Tessa chatbot to patients with eating disorders, have led to doubt about their reliability in high-stakes and safety-critical settings. In this work, we develop an evaluation framework for determining whether LLM response is a viable and ethical path forward for the automation of mental health treatment. Our framework measures equity in empathy and adherence of LLM responses to motivational interviewing theory. Using human evaluation with trained clinicians and automatic quality-of-care metrics grounded in psychology research, we compare the responses provided by peer-to-peer responders to those provided by a state-of-the-art LLM. We show that LLMs like GPT-4 use implicit and explicit cues to infer patient demographics like race. We then show that there are statistically significant discrepancies between patient subgroups: Responses to Black posters consistently have lower empathy than for any other demographic group (2%-13% lower than the control group). Promisingly, we do find that the manner in which responses are generated significantly impacts the quality of the response. We conclude by proposing safety guidelines for the potential deployment of LLMs for mental health response.

研究の動機と目的

  • 大規模言語モデル(LLM)が、人間のペア支援と同等の公平性と高い質の精神的健康対応を提供できるかどうかを評価すること。
  • GPT-4 などのLLMが、ソーシャルメディア投稿に基づいて患者の属性、特に人種を推論し、それに応じて異なる反応を示すかどうかを調査すること。
  • プロンプト工学の影響が、LLMが生成する精神的健康対応における人種的属性バイアスを低減する効果を評価すること。
  • LLMを用いた精神的健康アプリケーションにおける倫理的リスクとケアの質を監査するための計算フレームワークを構築すること。
  • LLMを臨床的・精神的健康分野に責任を持って導入するための安全ガイドラインを策定すること。

提案手法

  • 資格を持つ臨床心理学者による人間評価を実施し、LLMおよびペア間支援の反応について共感性、解釈、行動励起の観点から評価した。
  • 心理学研究に根ざした自動指標を用いて、ケアの質を評価した。具体的には、感情の受容と行動変容促進の指標を含む。
  • バイアス監査として、ソーシャルメディア投稿に明示的な人種的属性の手がかり(例:人種、性別)を追加し、サブグループ間での共感性の差を測定した。
  • GPT-4、GPT-3.5、Mental-LLaMa の反応を、人種に配慮した指示(MHF-2、MHF-3)を含むさまざまなプロンプト戦略で比較した。
  • 文脈やプロンプトの変動を制御した上で、統計的仮説検定を用いて、人種的属性サブグループ間での共感性の有意差を検出した。
  • 明示的な人種的属性プロンプトがバイアス軽減に与える影響を、行動心理学における内発的バイアスと外発的バイアスの低減に関する文献に基づいて評価した。

実験結果

リサーチクエスチョン

  • RQ1GPT-4 は、異なる人種的・民族的サブグループに対して、測定可能な共感性格差を示しているか?
  • RQ2LLM は、自由記述型のソーシャルメディア投稿から、人種などの患者属性を推論できるか?
  • RQ3共感性と行動励起の観点から、LLM の反応は人間のペア支援と比べてどの程度優れているか?
  • RQ4明示的な人種的属性プロンプトは、LLM が生成する精神的健康対応におけるバイアスをどの程度低減できるか?
  • RQ5精神的健康支援システムにLLMを導入する際の倫理的リスクとセーフティ上の懸念は何か?

主な発見

  • GPT-4 の反応は、特定のサブグループで共感性が低いものの、人間のペア支援に比べて行動変容を促進する効果が48%高い。
  • GPT-4 は統計的に有意な共感性格差を示し、黒人投稿者に対しては白人または人種不明の投稿者に比べて2%〜15%低い共感性を示した。
  • アジア系投稿者に対しても、対照群に比べて5%〜17%の共感性が著しく低い反応を示した。
  • より低い段階のモデルであるGPT-3.5でさえ、同じ条件下でGPT-4よりも高い全体的な共感性を示したため、モデルの進化が精神的健康ケアの質の向上を保証するわけではないことが示された。
  • 明示的な人種的属性プロンプト(MHF-2、MHF-3)により、サブグループ間での統計的に有意な共感性格差が解消され、GPT-4およびMental-LLaMaの反応におけるバイアスが効果的に軽減された。
  • LLM はテキスト内容から人種などの患者属性を推論できるため、プライバシー上の懸念や、推定されたアイデンティティに基づく差別的取り扱いの可能性が生じる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。