Skip to main content
QUICK REVIEW

[论文解读] Asymptotic Behavior of Bayesian Learners with Misspecified Models

Ignacio Esponda, Demián Pouzo|arXiv (Cornell University)|Apr 18, 2019
Decision-Making and Behavioral EconomicsDecision Sciences参考文献 42被引用 19
一句话总结

本文提出一个通用框架,用于分析使用模型误设的贝叶斯代理人学习环境时的长期行为。通过将行动频率动态与广义微分方程联系起来,该研究刻画了几乎必然收敛到吸引性均衡的情形,为在模型误设下经济学习中的持久偏见提供了统一的预测工具。

ABSTRACT

We consider an agent who represents uncertainty about the environment via a possibly misspecified model. Each period, the agent takes an action, observes a consequence, and uses Bayes' rule to update her belief about the environment. This framework has become increasingly popular in economics to study behavior driven by incorrect or biased beliefs. Current literature has characterized asymptotic behavior under fairly specific assumptions. By first showing that the key element to predict the agent's behavior is the frequency of her past actions, we are able to characterize asymptotic behavior in general settings in terms of the solutions of a generalization of a differential equation that describes the evolution of the frequency of actions. We then present a series of implications that can be readily applied to economic applications, thus providing off-the-shelf tools that can be used to characterize behavior under misspecified learning.

研究动机与目标

  • 理解持有现实误设模型的贝叶斯代理人在长期行为下的表现。
  • 识别在反复反馈下学习仍导致持久偏见的条件。
  • 将现有收敛结果推广至超越特定严格模型假设的更广泛情形。
  • 为在模型误设下的经济应用中预测渐近行为提供系统性方法。
  • 刻画行动频率在决定长期信念与行为动态中的作用。

提出的方法

  • 作者将代理人的学习过程建模为在误设统计模型下的贝叶斯更新机制。
  • 他们表明,信念与行为的渐近行为由过去行动的频率决定,而非行动本身。
  • 推导出一个广义微分方程,以描述行动频率随时间的演变。
  • 该框架利用行动频率空间中吸引集的概念,预测长期收敛。
  • 关键工具包括弱识别、最优响应对应关系的上半连续性,以及贝叶斯更新的鞅性质。
  • 分析通过拓扑与动态稳定性概念,区分严格均衡、排斥均衡以及边界情形(例如区间上的恒定信念),进行分类。

实验结果

研究问题

  • RQ1在何种条件下,持有误设模型的贝叶斯代理人会收敛到稳定的长期行为?
  • RQ2过去行动的频率如何影响信念与行为的渐近演化?
  • RQ3为何即使在反复反馈下仍会出现持久偏见?其方向由什么决定?
  • RQ4在误设学习模型中,长期均衡集合的特征是什么?哪些是稳定的?
  • RQ5在一般经济情境下,如何预测存在模型误设时信念与行为的收敛?

主要发现

  • 信念序列几乎必然收敛到以对应吸引性均衡的参数值为中心的狄拉克测度。
  • 在均衡为吸引性时,行动频率几乎必然收敛到在极限信念下最优的纯行动。
  • 由于相关均衡的非严格性,最优响应对应中垂直线段的端点被排除为极限。
  • 对应于水平线段内部点或恒定信念区域的均衡(情形3与4)为吸引性,因此几乎必然实现。
  • 极限信念与长期行动频率一致,且由于最优响应对应关系的上半连续性,价值函数在极限处连续。
  • 长期行动频率的集合包含于在共同信念下的短视最优响应集合中,表明极限行为的稳定性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。