Skip to main content
QUICK REVIEW

[論文レビュー] Asymptotic Behavior of Bayesian Learners with Misspecified Models

Ignacio Esponda, Demián Pouzo|arXiv (Cornell University)|Apr 18, 2019
Decision-Making and Behavioral EconomicsDecision Sciences参考文献 42被引用数 19
ひとこと要約

本稿は、環境について学習する際に誤ったモデルを使用するベイジアンエージェントの長期的行動を分析する一般化された枠組みを構築する。行動頻度のダイナミクスを一般化された微分方程式と結びつけることで、吸引的均衡へのほとんど確実な収束を特徴づけ、経済的学習におけるモデル誤りの下での持続的バイアスを予測する統一的なツールを提供する。

ABSTRACT

We consider an agent who represents uncertainty about the environment via a possibly misspecified model. Each period, the agent takes an action, observes a consequence, and uses Bayes' rule to update her belief about the environment. This framework has become increasingly popular in economics to study behavior driven by incorrect or biased beliefs. Current literature has characterized asymptotic behavior under fairly specific assumptions. By first showing that the key element to predict the agent's behavior is the frequency of her past actions, we are able to characterize asymptotic behavior in general settings in terms of the solutions of a generalization of a differential equation that describes the evolution of the frequency of actions. We then present a series of implications that can be readily applied to economic applications, thus providing off-the-shelf tools that can be used to characterize behavior under misspecified learning.

研究の動機と目的

  • 現実の誤ったモデルを持つベイジアンエージェントの長期的行動を理解すること。
  • 繰り返しフィードバックが存在しても持続的バイアスに至る条件を特定すること。
  • 特定の制限的なモデル仮定にとらわれない既存の収束結果の一般化。
  • モデル誤りを伴う経済的応用における漸近的行動を予測する体系的な手法の提供。
  • 行動頻度が長期的信念および行動ダイナミクスを決定する役割を特徴づけること。

提案手法

  • 著者たちは、誤った統計的モデルの下でのベイジアン更新メカニズムとしてエージェントの学習プロセスをモデル化する。
  • 彼らは、信念および行動の漸近的行動が、行動そのものではなく、過去の行動の頻度に依存することを示す。
  • 行動頻度の時間的変化を記述する一般化された微分方程式を導出する。
  • この枠組みは、行動頻度空間における吸引的集合の概念を用いて、長期的収束を予測する。
  • 主な道具は弱識別性、最適反応対応の上半連続性、およびベイジアン更新のマルティンゲール性である。
  • トポロジカルおよび動的安定性の概念を用いて、厳密な均衡、排斥的均衡、境界ケース(例えば、区間上で一定の信念)を区別する。

実験結果

リサーチクエスチョン

  • RQ1誤ったモデルを持つベイジアンエージェントが、安定した長期的行動に収束する条件は何か?
  • RQ2過去の行動の頻度は、信念および行動の漸近的進化にどのように影響するか?
  • RQ3繰り返しフィードバックが存在しても、なぜ持続的バイアスが生じるのか、その方向性を決定する要因は何か?
  • RQ4誤った学習モデルにおける長期的均衡の集合はどのように特徴づけられ、どの均衡が安定しているか?
  • RQ5一般の経済的状況において、モデル誤りを伴う学習の下で信念および行動の収束をどのように予測できるか?

主な発見

  • 信念の系列は、ほとんど確実に、吸引的均衡に対応するパrameter値を中心とするデルタ測度に収束する。
  • 均衡が吸引的であれば、行動頻度はほとんど確実に、極限的信念のもとで最適な純粋行動に収束する。
  • 非厳密な関連均衡のため、最適反応対応の垂直線分の端点は極限として除外される。
  • 水平線分の内部点または一定信念領域に対応する均衡(ケース3および4)は吸引的であり、したがってほとんど確実に実現される。
  • 極限的信念は長期的行動頻度と整合的であり、最適反応対応の上半連続性により、価値関数は極限で連続である。
  • 長期的行動頻度の集合は、共通の信念のもとでのミロック最適反応の集合に含まれるため、極限的行動の安定性が保証される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。