Skip to main content
QUICK REVIEW

[論文レビュー] LLM economicus? Mapping the Behavioral Biases of LLMs via Utility Theory

J. C. Ross, Yoon-Ji Kim|arXiv (Cornell University)|Aug 5, 2024
Private Equity and Venture CapitalBusiness, Management and Accounting被引用数 3
ひとこと要約

本稿では、行動経済学における代表的な実験ゲームを用いて、大規模言語モデル(LLMs)における経済的行動バイアスを定量化・比較する、ユーティリティ理論に基づくフレームワークを提案する。LLMsは、人間と合理的経済的エージェントの間で一貫性のない中間的行動を示しており、損失回避は弱く、時間割引は強い。また、プロンプト干渉はしばしば予測不可能な結果をもたらし、LLMsの経済的意思決定支援への整合性を高えることの難しさを浮き彫りにしている。

ABSTRACT

Humans are not homo economicus (i.e., rational economic beings). As humans, we exhibit systematic behavioral biases such as loss aversion, anchoring, framing, etc., which lead us to make suboptimal economic decisions. Insofar as such biases may be embedded in text data on which large language models (LLMs) are trained, to what extent are LLMs prone to the same behavioral biases? Understanding these biases in LLMs is crucial for deploying LLMs to support human decision-making. We propose utility theory-a paradigm at the core of modern economic theory-as an approach to evaluate the economic biases of LLMs. Utility theory enables the quantification and comparison of economic behavior against benchmarks such as perfect rationality or human behavior. To demonstrate our approach, we quantify and compare the economic behavior of a variety of open- and closed-source LLMs. We find that the economic behavior of current LLMs is neither entirely human-like nor entirely economicus-like. We also find that most current LLMs struggle to maintain consistent economic behavior across settings. Finally, we illustrate how our approach can measure the effect of interventions such as prompting on economic biases.

研究の動機と目的

  • 大規模言語モデル(LLMs)が、人間が生成したトレーニングデータから行動バイアスを引き継いでいるかどうか、特に経済的意思決定の文脈において評価すること。
  • ユーティリティ理論を用いた体系的で行動ベースの評価フレームワークを構築し、LLMsの経済的行動を人間のベンチマークと合理的経済モデルとで定量化・比較すること。
  • チェーン・オブ・スコウやFew-shotプロンプトなどのプロンプト技術が、LLMsにおける特定の経済的バイアスの緩和または拡大に与える影響を調査すること。
  • 異なる経済的状況におけるLLMs行動の不一致を特定し、人間的行動および合理的経済的行動からの逸脱をマッピングすること。
  • 金融および意思決定支援アプリケーションにおけるLLMsの信頼性と信頼性を高めるための今後の整合戦略の基盤を提供すること。

提案手法

  • 行動経済学における古典的実験ゲーム(例えば、アンタゴニスト・ゲーム、ディクタトール・ゲーム、トラスト・ゲーム)をテキストベースのプロンプトに変換し、LLMの応答を引き出す。
  • 反復的プロンプト(各ゲームターンあたりN回)を用いて応答分布をサンプリングし、LLM行動をモデル化するユーティリティ関数を適合させる。
  • ユーティリティ理論を適用して経済的バイアスを定量化:不平等回避、リスクおよび損失回避、双曲的時間割引。これらは人間の実験データから導かれた数学的関数を用いる。
  • 行動分析の前段階として、LLMsがゲームルールを正しく解釈・応答できるかを確認するための熟練度テストを実施。
  • 人間被験者から得られたオリジナルの行動経済学研究におけるユーティリティ関数と、適合されたLLMのユーティリティ関数を比較し、整合性と逸脱度を評価。
  • チェーン・オブ・スコウやFew-shotプロンプトなどのプロンプト干渉の効果を評価するため、設定ごとにユーティリティ関数パラメータの変化を測定。

実験結果

リサーチクエスチョン

  • RQ1LLMsは、人間と同様に不平等回避、損失回避、時間割引といった行動バイアスをどの程度示すか?
  • RQ2LLMsの経済的行動は、合理的経済的エージェント(すなわち、ホモ・エコノミクス)と比べてどう異なるか?
  • RQ3チェーン・オブ・スコウやFew-shotプロンプトといったプロンプト技術は、LLMsにおける経済的バイアスを一貫して軽減または是正できるか?
  • RQ4LLMsは、異なる意思決定文脈において一貫した経済的行動を示すか?
  • RQ5代表的な経済的ゲームにおいて、LLMsのユーティリティ関数は人間のものからどのような主要な逸脱を示すか?

主な発見

  • LLMsは合理的経済的エージェント(ホモ・エコノミクス)としても、完全に人間としても行動しない。代わりに、体系的な逸脱を示すハイブリッドな経済的行動を示す。
  • LLMsは人間と比較して損失回避が弱く、意思決定において潜在的な損失に対して感受性が低い。
  • LLMsは人間よりも強い時間割引を示しており、将来の利益よりも即時の報酬を好む傾向が強い。
  • LLMsは自分自身よりも他人に対して強い不平等回避を示しており、社会的意思決定においてある種の利他のバイアスを示している。
  • 大多数のLLMsは、異なるゲーム設定間で一貫した経済的行動を維持できず、意思決定フレームワークの不安定性が明らかになった。
  • チェーン・オブ・スコウやFew-shotプロンプトなどのプロンプト干渉は、LLMsの行動を変化させることがあるが、しばしば予測不能または一貫性のない結果をもたらすため、整合性のためのツールとしての信頼性が制限される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。