Skip to main content
QUICK REVIEW

[論文レビュー] Do LLMs exhibit human-like response biases? A case study in survey design

Lindia Tjuatja, Valerie Chen|arXiv (Cornell University)|Nov 7, 2023
Psychology of Social Influence被引用数 5
ひとこと要約

本研究では、大規模言語モデル(LLMs)が、人間の心理的バイアスを誘発する既知のバイアスを含む質問ペアに対して、人間と同様の反応バイアスを示すかどうかを調査する。9つのLLMを用いたキュレート済みのバイアスあり・バイアスなしの変種データセットを用い、著者らはLLMが人間の反応パターンを一般的に再現しないことを発見した。特に、RLHFでファインチューニングされたモデルは、実際のバイアスに対して感受性が低下する一方で、非バイアスの変種に対しては感受性が高まった。

ABSTRACT

As large language models (LLMs) become more capable, there is growing excitement about the possibility of using LLMs as proxies for humans in real-world tasks where subjective labels are desired, such as in surveys and opinion polling. One widely-cited barrier to the adoption of LLMs as proxies for humans in subjective tasks is their sensitivity to prompt wording - but interestingly, humans also display sensitivities to instruction changes in the form of response biases. We investigate the extent to which LLMs reflect human response biases, if at all. We look to survey design, where human response biases caused by changes in the wordings of "prompts" have been extensively explored in social psychology literature. Drawing from these works, we design a dataset and framework to evaluate whether LLMs exhibit human-like response biases in survey questionnaires. Our comprehensive evaluation of nine models shows that popular open and commercial LLMs generally fail to reflect human-like behavior, particularly in models that have undergone RLHF. Furthermore, even if a model shows a significant change in the same direction as humans, we find that they are sensitive to perturbations that do not elicit significant changes in humans. These results highlight the pitfalls of using LLMs as human proxies, and underscore the need for finer-grained characterizations of model behavior. Our code, dataset, and collected samples are available at https://github.com/lindiatjuatja/BiasMonkey

研究の動機と目的

  • 社会心理学で観察される人間らしき反応バイアスが、特にアンケート形式の質問文においてLLMに反映されているかどうかを評価すること。
  • 特にRLHFを含むモデルアーキテクチャーやトレーニング方式が、LLMの質問の言い回しの変更に対する感受性に与える影響を評価すること。
  • 既知の人間行動傾向と照らし合わせ、LLMの反応をバイアス誘発変種および非バイアス変種の両方に対して比較すること。
  • LLMがアンケートや世論調査における人間参加者としての代替として信頼できるかどうかという仮定に疑問を呈すること。

提案手法

  • 本研究では、人間の反応バイアスを誘発する質問ペアと、非バイアスの変種(例:スペルミス、言い換え)を含むペairedアンケート質問のデータセットを構築する。
  • オープンソースのLlama2バージョンとGPT-3.5やGPT-4などの商用モデルを含む9つのLLMに、これらの質問ペアを提示し、反応分布を収集する。
  • 反応のシフトを統計的検定(例:McNemar検定)を用いて、質問バージョン間での反応分布の有意変化を測定する。
  • 先行する社会科学の文献から得られた人間の反応傾向と照らし合わせ、モデルの行動がどれほど一致しているかを評価する。
  • トレーニング方式(例:インstructチューニング対比RLHFファインチューニング)の違いに応じてモデルを評価し、トレーニングがバイアス感受性に与える影響を特定する。
  • LLMが既知の人間の反応バイアスを再現するか、それとも非人間的な反応を示す非バイアス変更に対して過剰反応するかを体系的に評価するフレームワークを開発する。

実験結果

リサーチクエスチョン

  • RQ1微妙に言い回しが異なるアンケート質問にさらされた際、LLMは人間と同様の反応バイアスパターンを示すのか?
  • RQ2RLHFファインチューニングは、ベーシックまたはインstructチューニング済みモデルと比較して、LLMのバイアス誘発的質問変更に対する感受性にどのように影響するのか?
  • RQ3LLMは人間と同程度に非バイアスの変種(例:スペルミス、わずかな言い換え)に感受性を示すのか、それともそのような変化に対して過剰反応するのか?
  • RQ4モデルのサイズやアーキテクチャが、人間らしき反応バイアスを再現する可能性に与える影響はどの程度か?
  • RQ5LLMが人間の意見分布を模倣する能力と、実際の人間の反応バイアスを反映する能力の間に相関があるのか?

主な発見

  • 評価されたすべてのLLMが、一貫して人間らしき反応バイアスを再現しなかった。多くのモデルが、既知の人間の傾向とは逆方向に顕著な反応シフトを示した。
  • RLHFでファインチューニングされたモデルは、実際の反応バイアスに対して感受性が低下したが、スペルミスやわずかな言い換えといった非バイアス変種に対しては感受性が高まった。
  • 元の反応に高い不確実性を示すLLMは、バイアス誘発的変更によって顕著な変化を示す可能性が低く、人間とは異なった挙動を示した。
  • LLMが人間の意見分布を再現する能力と、実際の人間の反応バイアスを反映する能力との間に、ほとんど相関が見られなかった。
  • LLMが人間と同じ方向に反応シフトを示した場合でも、その大きさや一貫性は人間の行動パターンとはしばしば一致しなかった。
  • 結果として、RLHFは意味のある言語的手がかりへの自然な感受性を抑制する一方でノイズを増幅させる可能性があり、人間の代替としての有用性を損なう可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。