Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcement Learning for Combining Search Methods in the Calibration of Economic ABMs

Aldo Glielmo, Marco Favorito|arXiv (Cornell University)|Feb 23, 2023
Complex Systems and Time Series AnalysisEconomics, Econometrics and Finance参考文献 56被引用数 3
ひとこと要約

本論文は、経済エージェントベースモデル(ABMs)のキャリブレーションのため、複数の探索手法を動的に組み合わせる強化学習(RL)フレームワークを提案する。個々の手法や静的組み合わせに比べて優れた性能を発揮する。手法選択をマルチアームバンディット問題として扱い、RLエージェントはリアルタイムで適応し、高い性能を示す戦略を活用するとともに、パラメータの収束が止まった段階で代替戦略を探索する。ベンチマーク用ABMにおいて、事前のチューニングや仮定なしに、キャリブレーションの効率性が著しく向上する。

ABSTRACT

Calibrating agent-based models (ABMs) in economics and finance typically involves a derivative-free search in a very large parameter space. In this work, we benchmark a number of search methods in the calibration of a well-known macroeconomic ABM on real data, and further assess the performance of "mixed strategies" made by combining different methods. We find that methods based on random-forest surrogates are particularly efficient, and that combining search methods generally increases performance since the biases of any single method are mitigated. Moving from these observations, we propose a reinforcement learning (RL) scheme to automatically select and combine search methods on-the-fly during a calibration run. The RL agent keeps exploiting a specific method only as long as this keeps performing well, but explores new strategies when the specific method reaches a performance plateau. The resulting RL search scheme outperforms any other method or method combination tested, and does not rely on any prior information or trial and error procedure.

研究の動機と目的

  • 実データを用いた、代表的なマクロ経済ABMのキャリブレーションにおいて、多様な探索手法の性能を評価・比較すること。
  • 複数の探索戦略を組み合わせることで、個々の手法に内在するバイアスを軽減し、キャリブレーションの効率性を向上させられることを検証すること。
  • キャリブレーション中に最適な探索戦略を動的に選択する、自動的かつ適応的な手法選択フレームワークを開発すること。
  • 強化学習を用いた手法選択スキームが、事前のハイパーパramータチューニングなしに、個々の探索手法や固定された組み合わせを上回ることを示すこと。

提案手法

  • RLエージェントは、各探索手法を「アーム」とみなし、確率的報酬信号を持つマルチアームバンディット問題として手法選択を定式化する。
  • エージェントはエプソン・グリーディ戦略を用いて、探索と活用のバランスを保ち、性能の変化が止まった段階で手法を切り替える。
  • 報酬は、1回のモデル評価あたりの損失(例:モーメント法やユークリッド距離)の改善量として定義される。
  • RLエージェントはキャリブレーションの過程でリアルタイムに動作し、ABMシミュレーションからのフィードバックに基づいて方策を即座に更新する。
  • フレームワークは、2つのABM(BH4モデル(BrockとHommes, 1998)、SIRモデル)を用いて評価され、モーメント法とユークリッド距離の両方の損失関数が使用された。
  • 最適な手法の事前知識や試行錯誤によるチューニングを必要としないため、堅牢で汎用性の高いものである。

実験結果

リサーチクエスチョン

  • RQ1実データを用いた標準的なマクロ経済ABMのキャリブレーションにおいて、どの個々の探索手法が最も優れた性能を示すか?
  • RQ2複数の探索手法を組み合わせることで、単一の手法に比べてキャリブレーション性能が向上するか?
  • RQ3キャリブレーション中に最適な探索手法を自動的に選択できる適応的戦略は、どのように設計できるか?
  • RQ4強化学習に基づく手法選択スキームは、収束速度と正確性の観点から、静的組み合わせや個々の手法を上回るか?

主な発見

  • ランダムフォレストに基づくサーヴェイエート手法が、ベンチマーク用ABMにおいて、収束速度と正確性の両面で他の個々の探索戦略を上回った。
  • 複数の探索手法を組み合わせることで、いかなる単一手法にも内在するバイアスが軽減され、性能が一貫して向上した。
  • 提案された強化学習スキームが、テストされたあらゆる手法や組み合わせよりも優れた全体的な性能を達成した。収束が早く、より低い損失値に到達した。
  • RLエージェントは、優れた戦略を的確に特定・活用するとともに、パラメータの収束が止まった段階で代替戦略を探索することができたが、事前のハイパーパramータチューニングは不要であった。
  • モーメント法とユークリッド距離の両方の損失関数、およびBH4モデルとSIRモデルという異なるABMタイプにおいて、本手法は堅牢な性能を示した。
  • フレームワークは汎用的であり、分野特有の仮定や事前チューニングに依存しないため、ABMキャリブレーション分野への広範な応用が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。