Skip to main content
QUICK REVIEW

[논문 리뷰] Optimizing for the Future in Non-Stationary MDPs

Yash Chandak, Georgios Theocharous|arXiv (Cornell University)|2020. 05. 17.
Advanced Bandit Algorithms Research참고 문헌 66인용 수 8
한 줄 요약

이 논문은 비정상적인 마르코프 결정 과정(NS-MDP)에서 향후 성능을 사전에 최적화하기 위해 가짜 조건 추정과 곡선 피팅을 사용하여 정책 성능 추세를 예측하는 Prognosticator라는 정책 그래디언트 알고리즘을 제안한다. 적합된 성능 추세를 바탕으로 과거 데이터를 비균일하게 재가중함으로써, 이 방법은 성능 지연을 감소시키고 세 가지 시뮬레이션된 비정상 환경에서 온라인 적응 기법보다 뛰어난 성능을 보인다.

ABSTRACT

Most reinforcement learning methods are based upon the key assumption that the transition dynamics and reward functions are fixed, that is, the underlying Markov decision process is stationary. However, in many real-world applications, this assumption is violated, and using existing algorithms may result in a performance lag. To proactively search for a good future policy, we present a policy gradient algorithm that maximizes a forecast of future performance. This forecast is obtained by fitting a curve to the counter-factual estimates of policy performance over time, without explicitly modeling the underlying non-stationarity. The resulting algorithm amounts to a non-uniform reweighting of past data, and we observe that minimizing performance over some of the data from past episodes can be beneficial when searching for a policy that maximizes future performance. We show that our algorithm, called Prognosticator, is more robust to non-stationarity than two online adaptation techniques, on three simulated problems motivated by real-world applications.

연구 동기 및 목표

  • 환경의 동역학과 보상이 시간이 지남에 따라 변화하는 실세계 강화 학습 응용에서 발생하는 비정상성으로 인한 성능 지연 문제를 해결한다.
  • 변화가 발생한 후에 반응하기보다는 향후에 효과적인 정책을 사전에 탐색하는 방법을 개발한다.
  • 기본적인 비정상성 동역학이나 보상 이동을 명시적으로 모델링하지 않고도 데이터 효율적인 정책 최적화를 가능하게 한다.
  • 정상적인 설정에서는 표준 정책 그래디언트 방법과 호환성을 유지하면서도 비정상적인 설정에서의 강건성을 향상시킨다.

제안 방법

  • 이전 에피소드의 트레이젝터리에 기반해 가짜 조건 추론을 사용하여 과거 정책 성능을 추정한다.
  • 일변량 회귀 곡선(최소 제곱법 또는 가중 최소 제곱법 사용)을 피팅하여 정책 성능의 추세를 모델링한다.
  • 예측된 향후 성능를 정책 파라미터에 대해 미분하여 정책 최적화를 위한 그래디언트를 계산한다.
  • 적합된 성능 추세를 바탕으로 과거 데이터를 비균일하게 재가중함으로써 과거 성능 최소화를 통해 향후 예측을 향상시킨다.
  • 시간에 따라 변화하는 성능 추세를 모델링하기 위해 기저 함수(Fourier 또는 다항식)를 사용하며, 차원은 하이퍼파rameter 검색을 통해 조정한다.
  • 안정성을 확보하기 위해 중요도 샘플링과 클리핑을 사용하는 PPO와 같은 정책 그래디언트 프레임워크에 이 방법을 통합한다.

실험 결과

연구 질문

  • RQ1기본적인 비정상성 모델링 없이도 비정상적인 MDP에서 향후 성능을 예측하고 최적화할 수 있는 정책 그래디언트 방법을 설계할 수 있는가?
  • RQ2성능 추세에 기반한 과거 데이터의 비균일한 재가중이 동적 환경에서 향후 정책 최적화에 어떤 영향을 미치는가?
  • RQ3비정상 설정에서 온라인 적응 기법과 비교해 볼 때 제안된 방법이 성능 지연을 얼마나 줄이는가?
  • RQ4비정상 환경에서 탐색과 이용의 균형을 조절하는 하이퍼파rameter에 대해 이 방법의 민감도는 어느 정도인가?
  • RQ5정상 환경에서는 표준 정책 그래디언트로의 점진적 분해가 발생하는가?

주요 결과

  • Prognosticator는 추천 시스템, 목표 도달 환경, 당뇨병 치료 시뮬레이션을 포함한 세 가지 비정상 환경에서 FTRL-PG와 ONPG보다 성능 지연을 크게 감소시켰다.
  • 특히 진정한 보상 동역학을 관찰할 수 있는 비정상적인 추천 시스템에서, 이 방법의 성능는 시간이 지남에 따라 변화하는 최대 달성 보상의 추세를 거의 정확히 따라간다.
  • 선형 기저 함수보다 푸리에 또는 다항식 기저 함수를 사용한 추세 모델링이 훨씬 뛰어난 성능을 보이며, 이는 선형 기저 함수가 충분한 유연성을 갖추지 못하기 때문이다.
  • 모든 과거 에피소드를 활용함으로써 데이터 효율성을 유지하며, 변화하는 동역학을 명시적으로 모델링하지 않아도 안정적인 최적화를 달성한다.
  • 정상 설정에서는 Prognosticator가 표준 정책 그래디언트로 수렴하여 비정상성이 없는 경우 성능 손실가 발생하지 않는다.
  • 탐색과 이용의 균형을 조절하는 하이퍼파rameter에 민감하므로, 비정상 환경에서는 주의 깊은 튜닝이 필요하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.