[論文レビュー] Instructed to Bias: Instruction-Tuned Language Models Exhibit Emergent Cognitive Bias
この論文は、大規模言語モデル(LLMs)における指示微調整と人間フィードバックが、認知バイアス(特にダミー効果、確実性効果、信念バイアス)を誘発または強化する仕組みを、古典的な人間の意思決定実験をLLMsに適応させることで調査している。pretrainedモデルとは対照的に、Flan-T5、GPT-3.5、GPT-4といった指示微調整済みモデルでは顕著なバイアスが見られ、性能向上とバイアススコアの上昇が相関していることから、性能と公平性のトレードオフが生じている可能性が示唆されている。
Recent studies show that instruction tuning (IT) and reinforcement learning from human feedback (RLHF) improve the abilities of large language models (LMs) dramatically. While these tuning methods can help align models with human objectives and generate high-quality text, not much is known about their potential adverse effects. In this work, we investigate the effect of IT and RLHF on decision making and reasoning in LMs, focusing on three cognitive biases - the decoy effect, the certainty effect, and the belief bias - all of which are known to influence human decision-making and reasoning. Our findings highlight the presence of these biases in various models from the GPT-3, Mistral, and T5 families. Notably, we find a stronger presence of biases in models that have undergone instruction tuning, such as Flan-T5, Mistral-Instruct, GPT3.5, and GPT4. Our work constitutes a step toward comprehending cognitive biases in instruction-tuned LMs, which is crucial for the development of more reliable and unbiased language models.
研究の動機と目的
- 指示微調整および人間からの強化学習(RLHF)が、大規模言語モデルに認知バイアスを誘発または強化するかどうかを調査すること。
- 指示微調整済みLLMに、ダミー効果、確実性効果、信念バイアスという3つの核心的認知バイアスが存在するか、その程度を検証すること。
- GPT-3、GPT-3.5、GPT-4、Flan-T5に特に注目し、pretrainedモデルとその指示微調整版との間でバイアスレベルを比較すること。
- 論理的推論タスクにおけるモデルの精度とバイアススコアの関係を分析すること。
- 微調整によってモデルの整合性を向上させようとする手法が、意図せず認知バイアスを埋め込んだり、強化したりするという実証的証拠を提供すること。
提案手法
- 古典的な人間の認知バイアス実験をテキストベースの意思決定タスクに変換し、制御条件と処理条件を設けてLLMをテストした。
- 各バイアスごとに変動する数値およびテキストのプレースホルダーを含むテンプレート化されたプロンプトを用いて、大規模かつ半自動で生成されたデータセットを構築した。
- バイアスを、すべてのプロンプトにおいて制御条件と処理条件の間でのモデル選択の平均的シフトとして定義した。
- GPT-3、GPT-3.5、GPT-4、Flan-T5といった複数のLLMを同じバイアスタスクで評価し、モデルタイプ間でのバイアスレベルの比較を行った。
- 信念バイアスタスクにおけるモデルの精度とバイアススコアを定量化し、パフォーマンスとバイアスのトレードオフを評価した。
- 統計的分析を用いて、pretrainedモデルと指示微調整済みモデルの間、およびモデルのバリエーション間でのバイアススコアを比較した。
実験結果
リサーチクエスチョン
- RQ1指示微調整済み言語モデルは、ダミー効果、確実性効果、信念バイアスといった認知バイアスを示すか?
- RQ2指示微調整済みモデルのバイアスレベルは、そのpretrained版と比べてどの程度高いのか?
- RQ3論理的推論タスクにおいて、モデルの精度向上と認知バイアスの増大に相関関係があるか?
- RQ4異なる指示微調整済みモデル(例:GPT-3.5対GPT-4)は、バイアスの度合いに差を示すか?その差の背後には何があるのか?
- RQ5LLMに認知バイアスが現れる原因は、モデルアーキテクチャそのものではなく、微調整プロセスそのものに起因するのだろうか?
主な発見
- GPT-3.5やGPT-4といった指示微調整済みモデルは、確実性効果が顕著に現れ、期待値が高いリスクのある選択肢よりも確実な結果を好む傾向を示した。これは、pretrained版とは対照的である。
- Flan-T5 XXLモデルはダミー効果において–0.18の負のバイアススコアを示し、通常のバイアスパターンとは逆に、より高価なターゲット選択肢を一貫して好んだ。
- 信念バイアスタスクにおいて、GPT-3バージョンの精度が向上するにつれてバイアススコアも上昇しており、パフォーマンスとバイアスのトレードオフが示された。
- GPT-4は信念バイアスタスクで最高の精度(84%)を達成し、GPT-3.5やGPT-3.0よりも低いバイアススコア(0.07および0.49)を示した。これは、特定の訓練がバイアスを低減する可能性を示唆している。
- 本研究では、指示微調整が、pretrainedモデルに存在しなかった認知バイアスを誘発または強化することが判明した。特に意思決定および推論タスクにおいて顕著である。
- LLMにおけるバイアスパターンは人間の行動とは異なる。例えば、Flan-T5の高価な選択肢への一貫した好まない傾向は、通常の認知バイアス理論に反しており、モデル固有の行動様式を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。