Skip to main content
QUICK REVIEW

[論文レビュー] Language Shapes Mental Health Evaluations in Large Language Models

Jiayi Xu, Xiyang Hu|arXiv (Cornell University)|Mar 6, 2026
Mental Health Treatment and Access被引用数 0
ひとこと要約

要約: 本論文は GPT-4o および Qwen3 において、中国語でのプロンプトが英語よりもスティグマ関連の評価傾向を高め、その結果下流のメンタルヘルス分類に影響を与えることを示しており、LLM 評価に言語依存のバイアスが存在することを示唆している。

ABSTRACT

This study investigates whether large language models (LLMs) exhibit cross-linguistic differences in mental health evaluations. Focusing on Chinese and English, we examine two widely used models, GPT-4o and Qwen3, to assess whether prompt language systematically shifts mental health-related evaluations and downstream decision outcomes. First, we assess models' evaluative orientation toward mental health stigma using multiple validated measurement scales capturing social stigma, self-stigma, and professional stigma. Across all measures, both models produce higher stigma-related responses when prompted in Chinese than in English. Second, we examine whether these differences also manifest in two common downstream decision tasks in mental health. In a binary mental health stigma detection task, sensitivity to stigmatizing content varies across language prompts, with lower sensitivity observed under Chinese prompts. In a depression severity classification task, predicted severity also differs by prompt language, with Chinese prompts associated with more underestimation errors, indicating a systematic downward shift in predicted severity relative to English prompts. Together, these findings suggest that language context can systematically shape evaluative patterns in LLM outputs and shift decision thresholds in downstream tasks.

研究の動機と目的

  • 言語間の差(中国語と英語)がLLM出力におけるメンタルヘルスのスティグマ評価を系統的に形作るかを評価する。
  • 言語プロンプトがスティグマ検出やうつの重症度分類といった下流の意思決定タスクに影響を与えるかを判断する。
  • 構成概念レベルのスティグマのパターンを下流の意思決定閾値と結びつけ、言語間の公正性への影響を評価する。

提案手法

  • 公式APIを用いて2つの多言語LLM(GPT-4oと Qwen3-32B)を温度0.0で問合せ、決定論的出力とする。
  • 社会的自己的専門的領域を横断する検証済みの心理測定スティグマ指標を用いて評価傾向を測定する。
  • 社会的距離と危険性の認識を捉えるヴィネッタとDSMベースのシナリオを含める。
  • 中国語版のスティグマ検出ヴィネッタを翻訳・整合させ、ゼロショット設定で対をなす言語間比較を可能にする。
  • 対をなす言語プロンプトを用いた下流タスク(2値スティグマ検出と4段階のうつ重症度分類)を評価し、サンプルあたり合計30回の実行を集計する。

実験結果

リサーチクエスチョン

  • RQ1GPT-4oとQwen3は、中国語と英語のプロンプトでメンタルヘルスのスティグマ評価傾向に言語間差が現れるか。
  • RQ2言語による評価差が下流のスティグマ検出とうつ重症度分類の差として測定可能な影響を与えるか。
  • RQ3モデルとタスク間で、プロンプト言語による予測の校正の方向と規模はどの程度か。
  • RQ4観察された言語間効果は、サンプリング変動(温度)に対して頑健かつ複数のスティグマ指標で一貫性があるか。

主な発見

  • 両モデルとも、社会的・自己的・専門的領域で中国語プロンプト時にスティグマ関連スコアが高くなる。
  • GPT-4oは中国語プロンプト時に公的スティグマ(DDS)および個人的スティグマ(MISS)をより高く示す傾向を示し、Qwen3も同様のパターン(補足データ)を示す。
  • 中国語プロンプトはGPT-4oおよびQwen3のうつに特有のスティグマ(認知・個人的)を高める。
  • 自己スティグマ(SSOSH)と医療専門家スティグマ(OMS-HC)は中国語プロンプト時に両モデルで高くなる。
  • スティグマ検出では、英語プロンプトの方がGPT-4oの正確度が高い(0.737 vs 0.717)、Qwen3でも英語プロンプトの方が高く(0.769 vs 0.722)、特にQwen3で再現性の高いRecallの改善が見られる。
  • うつ重症度分類では全体的な正確度の差は小さいが、中国語プロンプトの方が過少推定が多く見られる傾向(GPT-4oでは例として 43 vs 11、Qwen3では 46 vs 17 の過少推定)を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。