Skip to main content
QUICK REVIEW

[論文レビュー] The Emergence of Economic Rationality of GPT

Yi‐Ting Chen, Tracy Xiao Liu|arXiv (Cornell University)|May 22, 2023
Topic Modeling被引用数 5
ひとこと要約

本研究は、選択の公理理論を用いて、リスク、時間、社会的選好、食事の4領域におけるGPTの予算配分意思決定を評価することで、GPTの経済的合理性を検討する。GPTは、同等の実験において人間被験者よりも高い合理性スコアを示し、人口統計的要因やランダムネスの変動に対しては頑健であるが、フレーミングや選択形式に敏感である。

ABSTRACT

As large language models (LLMs) like GPT become increasingly prevalent, it is essential that we assess their capabilities beyond language processing. This paper examines the economic rationality of GPT by instructing it to make budgetary decisions in four domains: risk, time, social, and food preferences. We measure economic rationality by assessing the consistency of GPT's decisions with utility maximization in classic revealed preference theory. We find that GPT's decisions are largely rational in each domain and demonstrate higher rationality score than those of human subjects in a parallel experiment and in the literature. Moreover, the estimated preference parameters of GPT are slightly different from human subjects and exhibit a lower degree of heterogeneity. We also find that the rationality scores are robust to the degree of randomness and demographic settings such as age and gender, but are sensitive to contexts based on the language frames of the choice situations. These results suggest the potential of LLMs to make good decisions and the need to further understand their capabilities, limitations, and underlying mechanisms.

研究の動機と目的

  • GPTが多様な分野において意思決定の経済的合理性を示すかどうかを評価すること。
  • 選択の公理理論を用いて、GPTの合理性を人間被験者と比較すること。
  • GPTの合理性がランダムネス、人口統計的フレーミング、選択文脈の変化に対してどの程度頑健であるかを検証すること。
  • 大規模言語モデル(LLM)と人間における好みのパラメータの多様性とその背後にあるメカニズムを調査すること。
  • LLMの意思決定品質が、将来的な経済的・社会的文脈におけるAIアプリケーションに与える影響を評価すること。

提案手法

  • GPTは各ドメインで100ポイントを2つの財に配分する25件の予算配分意思決定を実行するようプロンプトされた。
  • 合理性は、予算制約下での効用最大化の必要十分条件である一般化選択公理(GARP)を用いて測定された。
  • 4つの異なる意思決定環境が構築された:リスク資産、時間的選択、社会的移転、食事選好。
  • 合理性スコアはアフリャト効率インデックス(CCEI)および対数価格比と対数数量比のスピアーマン相関係数を用いて計算された。
  • 実験には、価格フレーミング(例:コスト対利益)、選択形式(連続的対離散的)、人口統計的フレーミング(年齢、性別、人種)の変化が含まれた。
  • 347名の米国被験者を対象とした並列的人間被験実験により、GPTと人間の合理性スコアを直接比較可能となった。

実験結果

リサーチクエスチョン

  • RQ1GPTはリスク、時間、社会的選好、食事選好の各分野において、予算配分タスクでどの程度経済的合理性を示すか?
  • RQ2同じ実験設定下で、GPTの合理性スコアは人間被験者と比べてどの程度か?
  • RQ3GPTの合理性は、ランダムネス、人口統計的フレーミング、選択文脈の変化に対して頑健か?
  • RQ4GPTが推定した好みのパラメータは、人間と比較して多様性と一貫性の点でどのようになるか?
  • RQ5言語フレーミングと選択形式は、GPTの合理性スコアにどのように影響を及けるか?

主な発見

  • 本研究および広範な文献において、GPTの合理性スコアは人間被験者よりも顕著に高いことが確認された。
  • GPTの合理性は、人口統計的要因(年齢、性別、人種、教育水準)および応答におけるランダムネスのレベルの変化に対しても頑健であった。
  • 選択タスクが異なる言語フレーミング(例:コスト対利益)や離散的選択形式で提示された場合、合理性スコアは著しく低下した。
  • GPTが推定した好みのパラメータは、人間被験者と比較して多様性が低く、より一貫性のある意思決定パターンを示した。
  • GPTの選択における対数価格比と対数数量比の相関は、人間被験者よりも強く、より効用最大化と整合していることを示した。
  • リスク、時間、社会的、食事の4領域すべてにおいて、GPTの意思決定はGARPと一貫しており、顕著な選択公理の一貫性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。