Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-agent Reinforcement Learning Accelerated MCMC on Multiscale Inversion Problem

Eric T. Chung, Yalchin Efendiev|arXiv (Cornell University)|2020. 11. 17.
Advanced Mathematical Modeling in Engineering참고 문헌 44인용 수 14
한 줄 요약

이 논문은 다중 척도 역문제를 위한 다중 수준 몬테카를로 마르코프 체인(MCMC) 샘플링을 가속화하기 위해 다중 에이전트 액터-크리틱 강화학습(RL) 프레임워크를 제안한다. RL 정책을 사용해 제안을 생성하고 중심화된 크리틱이 장기 보상을 추정함으로써, 특히 고대비 투과성 필드를 가진 시간에 의존하는 유동 역문제에서 $\epsilon$-그리디 전략과 결합할 경우 샘플링 효율성과 수렴 속도가 크게 향상됨을 입증하였다.

ABSTRACT

In this work, we propose a multi-agent actor-critic reinforcement learning (RL) algorithm to accelerate the multi-level Monte Carlo Markov Chain (MCMC) sampling algorithms. The policies (actors) of the agents are used to generate the proposal in the MCMC steps; and the critic, which is centralized, is in charge of estimating the long term reward. We verify our proposed algorithm by solving an inverse problem with multiple scales. There are several difficulties in the implementation of this problem by using traditional MCMC sampling. Firstly, the computation of the posterior distribution involves evaluating the forward solver, which is very time consuming for a problem with heterogeneous. We hence propose to use the multi-level algorithm. More precisely, we use the generalized multiscale finite element method (GMsFEM) as the forward solver in evaluating a posterior distribution in the multi-level rejection procedure. Secondly, it is hard to find a function which can generate samplings which are meaningful. To solve this issue, we learn an RL policy as the proposal generator. Our experiments show that the proposed method significantly improves the sampling process

연구 동기 및 목표

  • 전방 해석기 평가가 비용이 매우 비싸기 때문에 다중 척도 역문제의 MCMC 샘플링에서 발생하는 계산적 병목 현상을 해결하기 위해.
  • MCMC에서 효과적인 제안 분포를 설계하는 데 어려움이 있기 때문에 이를 강화학습을 통해 학습함으로써 이를 극복하기 위해.
  • 다중 수준 MCMC와 딥 RL을 통합하여 군집 척도 해석기를 활용해 계산 비용을 감소시키기 위해.
  • 고대비, 다중 척도 투과성 필드 역문제에서 샘플링 효율성과 수렴 속도를 향상시키기 위해.
  • 채널형 특징을 가진 시간에 의존하는 타원형 편미분방정식(PDE) 역문제에서 제안된 방법을 검증하기 위해.

제안 방법

  • 각 에이전트가 국소 상태 정보를 사용해 MCMC 제안을 생성하는 정책(액터)을 학습하는 다중 에이전트 액터-크리틱 RL 프레임워크를 설계하였다.
  • 전체 정보를 사용해 장기 보상을 추정하는 중심화된 크리틱이 존재하여 효율적인 정책 최적화를 가능하게 하였다.
  • 다중 수준 MCMC 프레임워크에서 전방 해석기로 일반화된 다중 척도 유한요소법(GMsFEM)을 사용하여 군집 척도 평가를 가속화하였다.
  • 미세 척도 평가를 피하기 위해 더 희박한 수준에서 제안을 조기에 기각함으로써 MCMC 수용 과정을 가속화하였다.
  • $\epsilon$-그리디 전략을 사용해 탐색과 이용의 균형을 맞추었으며, 확률 $p$로 RL 정책을, 확률 $1-p$로 무작위 걷기(random walks)를 사용하였다.
  • 훈련 안정성을 위해 경험 재생과 타겟 네트워크를 사용하였으며, 계산을 줄이기 위해 보상은 가장 희박한 수준의 전방 해석기를 사용해 계산하였다.

실험 결과

연구 질문

  • RQ1다중 에이전트 딥 강화학습은 다중 척도 역문제에서 MCMC 샘플링의 효율성을 향상시킬 수 있는가?
  • RQ2기존의 무작위 걷기 또는 커널 기반 제안과 비교해 RL이 생성한 제안은 수렴 속도 측면에서 어떻게 다른가?
  • RQ3GMsFEM를 활용한 다중 수준 MCMC 프레임워크는 고대비 투과성 필드 역문제에서 계산 비용을 얼마나 감소시키는가?
  • RQ4$\epsilon$-그리디 전략은 RL 가속 MCMC 프레임워크에서 샘플링 품질과 수렴에 어떤 영향을 미치는가?
  • RQ5분리된 액터를 가진 중심화된 크리틱은 복잡한 다중 척도 역문제에서 효과적인 제안 분포를 효과적으로 학습할 수 있는가?

주요 결과

  • RLMCMC 방법은 표준 MCMC의 383단계에서 174단계로 MCMC 단계 수를 감소시켜 수렴 속도를 크게 향상시켰다.
  • 표현 $\epsilon$-그리디 전략을 사용한 eRLMCMC 변종은 더 긴 총 계산 시간에도 불구하고 더 긴 샘플링 궤적을 통해 더 나은 수렴을 달성하였다.
  • eRLMCMC의 총 계산 시간은 13,472.4초였으며, 이는 더 큰 $\epsilon$ 값으로 인한 더 많은 기각으로 인해 RLMCMC(6,062.4초)보다 높았다.
  • 다중 수준 MCMC 프레임워크에 GMsFEM를 사용함으로써 군집 척도 평가가 효율적으로 이루어졌고, 기각 과정이 가속화되었다.
  • 분리된 액터를 가진 중심화된 크리틱은 표준 무작위 걷기 제안보다 샘플링 효율성이 뛰어난 제안 정책을 성공적으로 학습하였다.
  • 이 방법은 대비가 높은 조건에서도 안정성을 보이며, 대각선 채널형 투과성 필드를 가진 시간에 의존하는 유동 역문제에서 향상된 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.