[論文レビュー] Cognitive Bias in Decision-Making with LLMs
BiasBuster フレームワークは、ハイリスクな意思決定におけるLLMの認知バイアスを検出・緩和する。16,800-prompt dataset と self-debiasing prompts を備える。
Large language models (LLMs) offer significant potential as tools to support an expanding range of decision-making tasks. Given their training on human (created) data, LLMs have been shown to inherit societal biases against protected groups, as well as be subject to bias functionally resembling cognitive bias. Human-like bias can impede fair and explainable decisions made with LLM assistance. Our work introduces BiasBuster, a framework designed to uncover, evaluate, and mitigate cognitive bias in LLMs, particularly in high-stakes decision-making tasks. Inspired by prior research in psychology and cognitive science, we develop a dataset containing 13,465 prompts to evaluate LLM decisions on different cognitive biases (e.g., prompt-induced, sequential, inherent). We test various bias mitigation strategies, while proposing a novel method utilizing LLMs to debias their own human-like cognitive bias within prompts. Our analysis provides a comprehensive picture of the presence and effects of cognitive bias across commercial and open-source models. We demonstrate that our selfhelp debiasing effectively mitigates model answers that display patterns akin to human cognitive bias without having to manually craft examples for each bias.
研究の動機と目的
- LLM支援のハイリスクな意思決定における認知バイアスを監査する必要性を動機づけ、社会的バイアスと区別する。
- 認知科学に基づく認知バイアス検証フレームワーク(BiasBuster)を開発して、LLMのバイアスを定量化する。
- モデル間でのプロンプト誘発、逐次、固有のバイアスを評価するための広範な16,800-promptデータセットを作成する。
- ゼロショット、 Few-shot、自己デバイジング(セルフヘルプ)を含むさまざまなバイアス緩和手法を評価する。
- 自己ヘルプデバイジングが、手動でバイアス特化の例を作成せずに認知バイアスを低減できることを示す。
提案手法
- 認知バイアスのカテゴリ(プロンプトベース、固有、逐次)を定義し、認知科学実験に触発されたテストプロンプトにマッピングする。
- アンカー付け、現状維持、フレーミング、グループ帰属バイアスを含む16,800-promptデータセットを開発する。
- 意思決定分布、信頼度、予想と観測の選択間のユークリッド距離などの指標でバイアスを定量化する。
- 緩和戦略を比較する:ゼロショット、Few-shot(対比的/反事実)および自己ヘルププロンプティングで、モデル自身が自分のプロンプトを再記述する。
- 高リスクの学生受験スタイルのタスクに対して、複数のモデル(GPT-3.5-turbo、GPT-4、Llama-2 7B/13B)で評価する。
- 自己ヘルプ手続きを提案し、モデルが自分の応答をデバイアスするようプロンプトを再記述させ、その影響を評価する。
実験結果
リサーチクエスチョン
- RQ1LLMは高リスクな意思決定タスクにおいて、プロンプト誘発、逐次、固有の認知バイアスを示すのか。
- RQ2ゼロショット、Few-shot、自己ヘルプなどの異なるバイアス緩和戦略は、モデル間でのバイアスの頻度と意思決定の質にどのように影響するのか。
- RQ3LLMsは manualに作成されたバイアスの例なしで、自身のプロンプトをデバイアスできるのか(自己ヘルプ)。
- RQ4モデルの容量とタイプが認知バイアスの影響およびデバイジングの有効性にどのように影響するのか。
- RQ5受入決定に対するフレーミング、アンカー付け、プリミティ、現状維持、グループ帰属バイアスの比較的影響はどのようか。
主な発見
- 認知バイアス(フレーミングとグループ帰属)はモデル全体で存在し、GPT-4はフレーミングバイアスを、Llama-2-7Bはグループ帰属バイアスを示す。
- Few-shot緩和は失敗ケースを生み出し、オープンソースモデルの出力を大きく変える可能性がある。
- 自己ヘルプデバイジングは高容量モデルの意思決定の一貫性を改善し、場合によってはバイアス誘発プロンプトをゼロに削減できるが、モデルによって効果が異なる。
- 自己ヘルプは高容量モデルでプリミティ/アンカリング効果を低減するが、低容量モデルでは改善が限定的である。
- モデル容量は自己デバイジングの有効性に強く影響し、高容量モデルほどデバイジングの成功度が大きい。
- BiasBusterデータセットは、LLMにおける認知バイアスと緩和戦略の体系的な検証を可能にする。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。