Skip to main content
QUICK REVIEW

[論文レビュー] Learning to be Homo Economicus: Can an LLM Learn Preferences from Choice

Jeongbin Kim, Matthew Kovach|arXiv (Cornell University)|Jan 14, 2024
Forecasting Techniques and ApplicationsDecision Sciences被引用数 3
ひとこと要約

本稿は、GPT が選択データから経済的好みを学び、パーソナライズされたレコメンドを提供できるかを調査する。GPT を意思決定者またはレコメンドシステムとして振る舞わせるプロンプトを用いることで、本研究では GPT が期待効用最大化と一貫しており、リスク回避性に基づいたパーソナライズされたレコメンドを提供できることが判明したが、後悔回避性を十分に捉える能力に制限があることが示され、データからの部分的だが意味のある学習が行われていることが明らかになった。

ABSTRACT

This paper explores the use of Large Language Models (LLMs) as decision aids, with a focus on their ability to learn preferences and provide personalized recommendations. To establish a baseline, we replicate standard economic experiments on choice under risk (Choi et al., 2007) with GPT, one of the most prominent LLMs, prompted to respond as (i) a human decision maker or (ii) a recommendation system for customers. With these baselines established, GPT is provided with a sample set of choices and prompted to make recommendations based on the provided data. From the data generated by GPT, we identify its (revealed) preferences and explore its ability to learn from data. Our analysis yields three results. First, GPT's choices are consistent with (expected) utility maximization theory. Second, GPT can align its recommendations with people's risk aversion, by recommending less risky portfolios to more risk-averse decision makers, highlighting GPT's potential as a personalized decision aid. Third, however, GPT demonstrates limited alignment when it comes to disappointment aversion.

研究の動機と目的

  • GPT が選択データから好みを学ぶ能力を評価し、パーソナライズされた意思決定支援としての役割を果たせるかどうかを検証すること。
  • GPT の行動が露顯選好理論および期待効用最大化と一貫しているかどうかを検証すること。
  • サンプルサイズの関数として、GPT のパーソナライズされたレコメンドの質を評価すること。
  • 意思決定者としての GPT とレコメンドシステムとしての GPT のパフォーマンスを比較すること。
  • 経済的意思決定文脈における大規模言語モデル(LLM)の評価のための方法論的フレームワークを構築すること。

提案手法

  • リスク下での選択実験を Choi ら(2007)の研究に準拠し、GPT に人間の意思決定者として、またはレコメンドシステムとして応答させるプロンプトを用いる。
  • 露顯選好技術を用いて、期待効用最大化および効用最大化との整合性を検証する。
  • Afriat(1967)および Echenique ら(2023)の手法を用いて、GPT の応答から好みのパrameterをパラメトリックに回復する。
  • 人間被験者からのシミュレートされた選択データを GPT に提供し、好みを推定し、パーソナライズされたレコメンドを提供できるかを評価する。
  • 提供される選択データセットのサイズ(1 から 175 サンプルまで)を変化させ、パーソナライズの精度とサイズのトレードオフを測定する。
  • 散布図および回帰分析を用いて、GPT のレコメンド行動と真の人的リスク回避パrameterとの一致度を比較する。

実験結果

リサーチクエスチョン

  • RQ1GPT が意思決定者として振る舞う場合、期待効用最大化理論と整合的であると言えるか?
  • RQ2GPT がレコメンドシステムとして機能する際、少数の選択データから個人のリスク回避性をどれだけ学び、反映できるか?
  • RQ3GPT のパーソナライズされたレコメンドの能力は、選択データのサンプルサイズの増加に伴って向上するか?
  • RQ4GPT のレコメンド行動は、人間の好みとどの程度一致するか、特にリスク回避性と後悔回避性の捉え込みにおいて。
  • RQ5シンプルなプロンプトのみで、ファインチューニングや好みの構造に関する明示的指示なしに、GPT が経済的好みを学べるか?

主な発見

  • GPT が意思決定者としての役割を果たす場合、露顯選好分析により期待効用最大化と整合的であることが確認された。
  • レコメンドシステムとして機能する際、GPT は推定されたリスク回避性に基づき、ポートフォリオのパーソナライズされたレコメンドを的確に提供しており、サンプルサイズが増加するにつれて性能が著しく向上した。
  • 1つの選択サンプルのみの場合、GPT のレコメンドには意味のあるパーソナライズが見られず(回帰係数 = 0.002、p = 0.960)、サンプルサイズが増えると著しく改善した。
  • 真の人的リスク回避性と GPT が推定したリスク回避性との間の回帰線の勾配は、サンプルサイズの増加に伴い上昇し、GPT がデータから強く学習していることが示された。
  • GPT は後悔回避性を十分に捉えておらず、高次のリスク好みのモデル化に限界があることが示された。
  • GPT-4 は GPT-3.5-turbo よりも安定性とパーソナライズ性において優れており、モデルサイズおよびアーキテクチャがパフォーマンスに顕著に影響していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。