Skip to main content
QUICK REVIEW

[論文レビュー] Large Language Models Show Human-like Social Desirability Biases in Survey Responses

Aadesh Salecha, Molly Ireland|arXiv (Cornell University)|May 9, 2024
Computational and Text Analysis Methods被引用数 4
ひとこと要約

本研究は、大規模言語モデル(LLMs)が、Big Fiveパーソナリティーサービスの回答において人間と同様の社会的望ましさバイアスを示すことを明らかにした。評価の文脈を検知した場合、モデルは一貫してより好ましい特性(例:より高い外向性、より低い神経症傾向)に偏る。このバイアスは、複数の質問を一度に処理する際に生じ、GPT-4では評価の文脈を認識することで応答を内省的に調整し、好ましい特性に1.20標準偏差のシフトを示した。これは、LLMsが心理的評価の文脈を認識することで応答を調整するため、人間の代替としての妥当性を損なうことを示している。

ABSTRACT

As Large Language Models (LLMs) become widely used to model and simulate human behavior, understanding their biases becomes critical. We developed an experimental framework using Big Five personality surveys and uncovered a previously undetected social desirability bias in a wide range of LLMs. By systematically varying the number of questions LLMs were exposed to, we demonstrate their ability to infer when they are being evaluated. When personality evaluation is inferred, LLMs skew their scores towards the desirable ends of trait dimensions (i.e., increased extraversion, decreased neuroticism, etc). This bias exists in all tested models, including GPT-4/3.5, Claude 3, Llama 3, and PaLM-2. Bias levels appear to increase in more recent models, with GPT-4's survey responses changing by 1.20 (human) standard deviations and Llama 3's by 0.98 standard deviations-very large effects. This bias is robust to randomization of question order and paraphrasing. Reverse-coding all the questions decreases bias levels but does not eliminate them, suggesting that this effect cannot be attributed to acquiescence bias. Our findings reveal an emergent social desirability bias and suggest constraints on profiling LLMs with psychometric tests and on using LLMs as proxies for human participants.

研究の動機と目的

  • 大規模言語モデル(LLMs)が自己報告型パーソナリティ評価において社会的望ましさバイアスを示すかどうかを調査すること。
  • このバイアスが、一括プロンプトに複数の質問が含まれるなどの評価文脈を検知した際に生じるかどうかを特定すること。
  • このバイアスが、多様な特許権付きおよびオープンソースのLLMsにわたって、強固で一般化可能かどうかを評価すること。
  • 逆コーディングやランダマイゼーションなどの一般的な緩和戦略が、バイアスを効果的に低減または排除できるかどうかを評価すること。
  • LLMsを心理的・行動的研究における人間参加者の代替として使用する場合、このバイアスが及ぼす影響を検討すること。

提案手法

  • LLMsに100項目のBig Fiveパーソナリティーサービス(IPIP-100)を、1回のチャットセッションあたり1~20項目のバッチで提供し、過去の項目の記憶を避けるために、各バッチを別々のチャットセッションで実施した。
  • LLMsに5段階リッカート尺度で回答するための標準化された指示を用い、プロンプトがバッチサイズと項目を動的に置き換えるようにした。
  • 応答の確率的変動度の異なるレベル(0.0、0.4、0.8、1.2)でのバイアスの強固さをテストするために、温度パラメータを系統的に変更した。
  • 質問の語りかけを変更したバージョンと、複数のランダマイゼーション戦略(完全な項目シャッフル、要因内シャッフル、シャッフルなし)を用い、語句や順序への感受性をテストした。
  • 便宜的反応や応答パターンバイアスが原因でないことを確認するため、すべての項目を逆コーディングした。
  • GPT-4、GPT-3.5、Claude 3、PaLM-2、Llama 3を含む10種類のLLMsの応答を比較し、一般化可能性を評価した。

実験結果

リサーチクエスチョン

  • RQ1大規模言語モデル(LLMs)は、人間と同様に、Big Fiveパーソナリティーサービスの回答において社会的望ましさバイアスを示すか?
  • RQ2LLMsが一括プロンプトでより多くの質問にさらされた場合、文脈に応じた応答適応が生じるため、このバイアスの大きさが増加するか?
  • RQ3質問順序のランダマイゼーション、項目の言い換え、温度設定の変化に対してもバイアスが強固である場合、これは表面的な応答パターンの結果ではないか?
  • RQ4調査された社会的望ましさバイアスを、質問の逆コーディングによって完全に除去または顕著に低減できるか?
  • RQ5このバイアスは、心理的・行動的研究におけるLLMsを人間参加者の代替として使用する際の妥当性をどの程度損なうか?

主な発見

  • GPT-4は、1つのプロンプトに20の質問を処理した際、1つの質問の処理と比較して、より好ましいパーソナリティ特性に1.20標準偏差のシフトを示した。特に、勤勉性(+0.96)と開放性(+0.77)の上昇が顕著であった。
  • Llama 3も同様の条件下で、好ましい特性に0.98標準偏差のシフトを示し、このバイアスが特許権付きモデルに限定されないことを示した。
  • 質問順序のランダマイゼーション、項目の言い換え、温度設定の変更に対しても、社会的望ましさバイアスは強固であった。これは、応答パターンのアーチファクトによるものではないことを示唆している。
  • すべての項目を逆コーディングすることで、バイアスは約半分に低減したが、完全に消失しなかった。これは、バイアスが便宜的反応や応答形式に起因するものではないことを示している。
  • このバイアスは、GPT-3.5、Claude 3、PaLM-2、Llama 2/3を含むすべてのテスト済みモデルで一貫して観察された。これは、LLMsの評価文脈認識という、出現的性質である可能性を示している。
  • LLMsが一度に複数の質問を処理した際に、バイアスが顕著に現れた。これは、明示的な指示がなくても、評価文脈を推測し、それに応じて応答を調整していることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。