[論文レビュー] Underneath the Numbers: Quantitative and Qualitative Gender Fairness in LLMs for Depression Prediction
本研究では、抑うつ予測における大規模言語モデル(LLM)の性別フェアネスを、定量的および定性的な手法を用いて調査した。定量的フェアネス指標ではLLaMA 2が優れている一方で、ChatGPTはより包括的で一貫性があり、文脈的に適切な定性的な説明を提供しており、LLMにおける数値的フェアネスと解釈的フェアネスのトレードオフを浮き彫りにしている。
Recent studies show bias in many machine learning models for depression detection, but bias in LLMs for this task remains unexplored. This work presents the first attempt to investigate the degree of gender bias present in existing LLMs (ChatGPT, LLaMA 2, and Bard) using both quantitative and qualitative approaches. From our quantitative evaluation, we found that ChatGPT performs the best across various performance metrics and LLaMA 2 outperforms other LLMs in terms of group fairness metrics. As qualitative fairness evaluation remains an open research question we propose several strategies (e.g., word count, thematic analysis) to investigate whether and how a qualitative evaluation can provide valuable insights for bias analysis beyond what is possible with quantitative evaluation. We found that ChatGPT consistently provides a more comprehensive, well-reasoned explanation for its prediction compared to LLaMA 2. We have also identified several themes adopted by LLMs to qualitatively evaluate gender fairness. We hope our results can be used as a stepping stone towards future attempts at improving qualitative evaluation of fairness for LLMs especially for high-stakes tasks such as depression detection.
研究の動機と目的
- 既存のLLM(ChatGPT、LLaMA 2、Bard)における抑うつ検出の性別バイアスを調査すること。
- LLMにおける純粋な定量的フェアネス評価の限界を明らかにすること。
- 数値的指標を超えた定性的フェアネス評価戦略の開発および適用すること。
- LLMがメンタルヘルス予測タスクにおけるフェアネス基準をどのように解釈し、応答するかを検討すること。
- 説明の質と一貫性を通じた人間中心のフレームワークを提供することによるフェアネス評価に貢献すること。
提案手法
- 2つの広く使われている抑うつ検出データセットを用いて、3つのLLM(ChatGPT、LLaMA 2、Bard)を比較評価した。
- 性別サブグループごとのグループフェアネス、精度、適合率といった定量的フェアネス指標を適用した。
- テーマ分析および語数分析を含む定性的評価戦略を開発し、説明の質を評価した。
- フェアネス関連の推論における包括性、一貫性、的確さ、整合性に基づいてLLMの応答を評価した。
- 理解しやすさ、パーソナライズ性、文脈的関連性といった人間中心の基準を用いて、説明の質を評価した。
- LLMが生成するフェアネス評価において繰り返し現れるテーマ(例:性別中立的言語の使用、性別に関する仮定の回避)を同定した。

実験結果
リサーチクエスチョン
- RQ1既存のLLMは抑うつ予測タスクにおいてどの程度性別バイアスを示しているか?
- RQ2LLMは性別サブグループごとに定量的フェアネス性能でどのように異なるか?
- RQ3説明の定性的評価は、数値的指標を超えたフェアネスの洞察を明らかにできるか?
- RQ4LLMはメンタルヘルス予測における自らの性別フェアネスを評価する際にどのようなテーマを使用するか?
- RQ5説明の質と一貫性は、LLMが生成する予測におけるフェアネスの認識にどのように影響するか?
主な発見
- LLaMA 2は、予測性能の性別サブグループ間でのバランスが優れており、定量的フェアネス指標で他のLLMを上回った。
- ChatGPTは、LLaMA 2よりも包括的で一貫性があり、文脈的に適切な説明を提供しており、LLaMA 2はしばしば一貫性のない、または自己矛盾する応答を示した。
- LLaMA 2は、フェアネス評価プロンプトに応答する代わりに、ユーザーの要求を満たすか、関係のない内容を追加する傾向があり、タスクへの適合性が低いことが示された。
- ChatGPTは一貫して、『they』や『participant』といった性別中立的言語を使用しており、フェアネスのベストプラクティスに適合していた。
- LLaMA 2は『participant』の使用を非性別的であると批判したが、これは自らの提示したフェアネス基準と矛盾しており、内部的な一貫性の欠如を示している。
- 本研究は、トレードオフが存在することを明らかにした:LLaMA 2は定量的フェアネスに優れており、一方でChatGPTは説明の質を通じて優れた定性的フェアネスを示している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。