Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement Learning for Combining Search Methods in the Calibration of Economic ABMs

Aldo Glielmo, Marco Favorito|arXiv (Cornell University)|2023. 02. 23.
Complex Systems and Time Series AnalysisEconomics, Econometrics and Finance참고 문헌 56인용 수 3
한 줄 요약

이 논문은 경제학적 에이전트기반모델(ABMs) 校정을 위해 다수의 검색 방법을 동적으로 조합하는 강화학습(RL) 프레임워크를 제안한다. 이는 개별적 또는 정적 조합보다 뛰어난 성능을 발휘한다. 방법 선택을 다중 손잡이 슬롯머신 문제로 간주함으로써, RL 에이전트는 실시간으로 적응하여 고성능 전략을 활용하고, 정체기에는 대안을 탐색한다. 이로 인해 사전 조정이나 가정 없이 기준 ABM에서 보다 뛰어난 校정 효율성을 달성한다.

ABSTRACT

Calibrating agent-based models (ABMs) in economics and finance typically involves a derivative-free search in a very large parameter space. In this work, we benchmark a number of search methods in the calibration of a well-known macroeconomic ABM on real data, and further assess the performance of "mixed strategies" made by combining different methods. We find that methods based on random-forest surrogates are particularly efficient, and that combining search methods generally increases performance since the biases of any single method are mitigated. Moving from these observations, we propose a reinforcement learning (RL) scheme to automatically select and combine search methods on-the-fly during a calibration run. The RL agent keeps exploiting a specific method only as long as this keeps performing well, but explores new strategies when the specific method reaches a performance plateau. The resulting RL search scheme outperforms any other method or method combination tested, and does not rely on any prior information or trial and error procedure.

연구 동기 및 목표

  • 실제 데이터를 사용하여 잘 알려진 거시경제학적 ABM의 校정에 다양한 검색 방법의 성능을 평가하고 비교하기.
  • 다양한 검색 전략을 조합함으로써 개별 방법의 편향을 완화하고 校정 효율을 향상시킬 수 있는지 조사하기.
  • 보정 중에 가장 적절한 검색 전략을 동적으로 선택할 수 있는 자동화되고 적응 가능한 방법 선택 프레임워크 개발하기.
  • 강화학습 기반의 방법 선택 기법이 사전 하이퍼파rameter 조정 없이도 개별 방법과 고정 조합보다 수렴 속도와 정확도 측면에서 뛰어나다는 것을 입증하기.

제안 방법

  • RL 에이전트는 각 검색 방법을 '손잡이'로 간주하고, 이를 다중 손잡이 슬롯머신 문제로 모델링한다. 이때 보상 신호는 확률적이다.
  • 에이전트는 탐색과 이용의 균형을 이루기 위해 이psilon-그리디 전략을 사용하며, 성능이 정체될 경우 방법을 전환한다.
  • 보상은 모델 평가당 손실의 향상도로 정의된다 (예: 모멘트 방법 또는 유클리드 거리).
  • RL 에이전트는 보정 과정 중 실시간으로 작동하며, ABM 시뮬레이션으로부터의 실시간 피드백에 기반해 정책을 업데이트한다.
  • 이 프레임워크는 두 가지 ABM (BH4 모델 (Brock and Hommes, 1998) 및 SIR 모델) 을 대상으로 평가되었으며, 모멘트 방법과 유클리드 거리 손실 함수를 모두 사용하였다.
  • 최적의 방법에 대한 사전 지식나 시도 오류 기반 튜닝이 필요 없어, 이는 강건성과 일반화 능력을 높인다.

실험 결과

연구 질문

  • RQ1실제 데이터를 사용한 표준 거시경제학적 ABM 보정에서 어떤 개별 검색 방법이 가장 우수한 성능을 보였는가?
  • RQ2여러 검색 방법을 조합함으로써 단일 방법의 성능을 초월하는 보정 성능 향상을 달성할 수 있는가?
  • RQ3보정 과정 중에 가장 적절한 검색 방법을 자동으로 선택할 수 있는 적응 전략은 어떻게 설계할 수 있는가?
  • RQ4강화학습 기반의 방법 선택 기법이 정적 조합과 개별 방법보다 수렴 속도와 정확도 측면에서 뛰어나다는가?

주요 결과

  • 랜덤 포레스트 기반 서rogate 방법이 기준 ABM에서 수렴 속도와 정확도 측면에서 다른 개별 검색 전략보다 뛰어났다.
  • 검색 방법을 조합함으로써 단일 방법에 내재된 편향을 완화하고 성능 향상을 일관되게 달성하였다.
  • 제안된 강화학습 기반 기법이 가장 우수한 종합 성능을 보였으며, 모든 테스트된 방법이나 조합보다 더 빠르게 수렴하고 더 낮은 손실 값을 도달하였다.
  • RL 에이전트는 사전 하이퍼파rameter 조정 없이도 고성능 전략을 성공적으로 식별하고 활용하면서 정체기에는 대안을 탐색하였다.
  • 이 방법은 모멘트 방법과 유클리드 거리 모두 다른 손실 함수와 BH4 및 SIR 모델 등 다양한 ABM 유형에서 강건성을 보였다.
  • 이 프레임워크는 도메인 특화 가정이나 사전 튜닝에 의존하지 않아 일반화 가능하며, ABM 보정 분야에 넓은 적용에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.