[论文解读] Learning to be Homo Economicus: Can an LLM Learn Preferences from Choice
本文研究了GPT能否从选择数据中学习经济偏好并提供个性化推荐。通过提示GPT扮演决策者或推荐系统角色,研究发现GPT始终与预期效用最大化保持一致,并能根据风险规避程度个性化推荐,尽管其在捕捉失望规避方面能力有限,表明其从数据中实现了部分但有意义的学习。
This paper explores the use of Large Language Models (LLMs) as decision aids, with a focus on their ability to learn preferences and provide personalized recommendations. To establish a baseline, we replicate standard economic experiments on choice under risk (Choi et al., 2007) with GPT, one of the most prominent LLMs, prompted to respond as (i) a human decision maker or (ii) a recommendation system for customers. With these baselines established, GPT is provided with a sample set of choices and prompted to make recommendations based on the provided data. From the data generated by GPT, we identify its (revealed) preferences and explore its ability to learn from data. Our analysis yields three results. First, GPT's choices are consistent with (expected) utility maximization theory. Second, GPT can align its recommendations with people's risk aversion, by recommending less risky portfolios to more risk-averse decision makers, highlighting GPT's potential as a personalized decision aid. Third, however, GPT demonstrates limited alignment when it comes to disappointment aversion.
研究动机与目标
- 评估GPT从选择数据中学习偏好的能力,并作为个性化决策辅助工具的适用性。
- 检验GPT的行为是否与显示偏好理论和期望效用最大化一致。
- 评估GPT个性化推荐的质量随样本量的变化情况。
- 比较GPT作为决策者与作为推荐系统的表现差异。
- 构建一种方法论框架,用于评估大型语言模型在经济决策情境中的表现。
提出的方法
- 在风险条件下复制Choi等人(2007)的选择实验,提示GPT以人类决策者或推荐系统身份作答。
- 使用显示偏好技术检验其与效用最大化及期望效用最大化的契合度。
- 采用Afriat(1967)和Echenique等人(2023)的方法,从GPT的回应中参数化恢复偏好参数。
- 向GPT提供来自人类受试者的模拟选择数据,以评估其推断偏好和生成个性化推荐的能力。
- 改变所提供选择数据集的大小(从1到175个样本),以衡量个性化中准确率与样本量之间的权衡。
- 通过散点图和回归分析,将GPT的推荐行为与真实的人类风险规避参数进行比较。
实验结果
研究问题
- RQ1当被提示作为决策者时,GPT的选择是否与期望效用最大化理论一致?
- RQ2当作为推荐系统运行时,GPT在仅基于少量选择数据的情况下,能在多大程度上学习并反映个体的风险规避程度?
- RQ3随着选择数据样本量的增加,GPT个性化推荐的能力是否会提升?
- RQ4GPT的推荐行为在多大程度上与人类偏好一致,特别是在捕捉风险规避与失望规避方面?
- RQ5简单的提示是否足以使GPT在无需微调或显式指令偏好结构的情况下学习经济偏好?
主要发现
- 作为决策者时,GPT的选择经由显示偏好分析确认,与期望效用最大化一致。
- 当作为推荐系统运行时,GPT能成功根据推断出的风险规避程度个性化投资组合推荐,且性能随样本量增加而显著提升。
- 仅提供一个选择样本时,GPT的推荐无明显个性化特征(回归系数 = 0.002,p = 0.960),但随着数据集增大,性能显著改善。
- 真实人类风险规避程度与GPT估算的风险规避程度之间的回归线斜率随样本量增加而上升,表明其从数据中表现出强烈的学习能力。
- GPT未能充分捕捉失望规避,表明其在建模高阶风险偏好方面存在局限。
- GPT-4在稳定性和个性化方面优于GPT-3.5-turbo,表明模型规模和架构对性能有显著影响。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。