Skip to main content
QUICK REVIEW

[논문 리뷰] Self-Optimizing and Pareto-Optimal Policies in General Environments based on Bayes-Mixtures

Marcus Hütter|ArXiv.org|2002. 04. 17.
Reinforcement Learning in Robotics참고 문헌 11인용 수 20
한 줄 요약

이 논문은 일반적인 확률적 환경에서 파레토 최적이고 자기 최적화(self-optimizing) 정책을 도출하기 위해 베이즈 혼합을 사용하는 베이지안 강화 학습 프레임워크를 제안한다. $ \mathcal{M} $가 어느 정도의 자기 최적화 정책를 포함하면, 클래스 $ \mathcal{M} $에서의 혼합 $ \xi $에 기반한 베이즈 최적 정책 $ p^\xi $가 자기 최적화임을 증명한다—이로써 비어 있지 않은 효과적 수명이 무한한 에르고딕 마르코프 결정 과정(ergodic MDPs)에 대해 처음으로 순수하게 베이지안적이며 일관된 자기 최적화 정책를 제공한다.

ABSTRACT

The problem of making sequential decisions in unknown probabilistic environments is studied. In cycle $t$ action $y_t$ results in perception $x_t$ and reward $r_t$, where all quantities in general may depend on the complete history. The perception $x_t$ and reward $r_t$ are sampled from the (reactive) environmental probability distribution $μ$. This very general setting includes, but is not limited to, (partial observable, k-th order) Markov decision processes. Sequential decision theory tells us how to act in order to maximize the total expected reward, called value, if $μ$ is known. Reinforcement learning is usually used if $μ$ is unknown. In the Bayesian approach one defines a mixture distribution $ξ$ as a weighted sum of distributions $ν\in\M$, where $\M$ is any class of distributions including the true environment $μ$. We show that the Bayes-optimal policy $p^ξ$ based on the mixture $ξ$ is self-optimizing in the sense that the average value converges asymptotically for all $μ\in\M$ to the optimal value achieved by the (infeasible) Bayes-optimal policy $p^μ$ which knows $μ$ in advance. We show that the necessary condition that $\M$ admits self-optimizing policies at all, is also sufficient. No other structural assumptions are made on $\M$. As an example application, we discuss ergodic Markov decision processes, which allow for self-optimizing policies. Furthermore, we show that $p^ξ$ is Pareto-optimal in the sense that there is no other policy yielding higher or equal value in {\em all} environments $ν\in\M$ and a strictly higher value in at least one.

연구 동기 및 목표

  • 알 수 없는 확률적 환경에서 행동하는 합리적 에이전트를 위한 일반적 프레임워크를 개발하기 위해 베이즈 혼합 모델을 사용한다.
  • 알려진 클래스 $ \mathcal{M} $의 모든 환경에서 베이즈 최적 정책 $ p^\xi $가 渐近 최적성(자기 최적화)을 달성할 조건을 설정한다.
  • 클래스 $ \mathcal{M} $에 대한 추가적인 구조적 가정 없이도 $ p^\xi $가 파레토 최적임—즉, $ \mathcal{M} $의 모든 환경에서 다른 정책가 $ p^\xi $를 초월하지 못함—을 증명한다.
  • 에르고딕 마르코프 결정 과정(MDPs)에서 자기 최적화 정책가 존재함을 보이며, 베이즈 최적 정책 $ p^\xi $가 이 성질을 달성함을 보여준다.
  • 베이즈 강화 학습에 대한 기존 결과를 통합하고 확장하여, 자기 최적화 정책가 존재하는 데 필요한 조건이 베이즈 혼합 정책에 대해 충분조건이 됨을 보여준다.

제안 방법

  • 행동가가 환경의 확률적 분포 $ \mu $에 따라 인지와 보상을 경험하는 일반적인 환경 모델을 정의하며, 이는 비마르코프 및 부분 관측 가능 과정을 포함한다.
  • 알려진 환경 클래스 $ \mathcal{M} $에 대해 우선 확률 $ w_\nu $를 사용하여 혼합 $ \xi = \sum_{\nu \in \mathcal{M}} w_\nu \nu $를 구성한다. 이는 진짜 환경 $ \mu $를 포함한다.
  • 혼합 분포 $ \xi $ 하에서 기대값 $ V_\xi^p $를 최대화하는 정책으로서, 혼합 값의 선형성과 볼록성을 활용하여, 베이즈 최적 정책 $ p^\xi $를 정의한다.
  • 모든 $ \nu \in \mathcal{M} $에서 동일하거나 더 높은 가치를 제공하고, 어떤 경우에도 엄밀히 더 높은 가치를 제공하는 다른 정책가 존재하지 않음을 증명함으로써, $ p^\xi $가 파레토 최적임을 보인다.
  • 자기 최적화 수렴 보장: $ \mathcal{M} $가 자기 최적화 정책를 포함하면, $ m \to \infty $일 때 $ \frac{1}{m} V_{1m}^{p^\xi \nu} \to \frac{1}{m} V_{1m}^{*\nu} $가 성립한다.
  • 할인율이 $ \gamma_{k+1}/\gamma_k \to 1 $을 만족하는 무한 수명 할인 모델로 결과를 확장하여, 할인된 가치가 최적 가치로 수렴함을 보여준다.

실험 결과

연구 질문

  • RQ1클래스 $ \mathcal{M} $의 모든 환경에서 베이즈 최적 정책 $ p^\xi $가 자기 최적화가 되기 위한 조건은 무엇인가?
  • RQ2클래스 $ \mathcal{M} $에 대한 추가 가정 없이도, $ p^\xi $가 파레토 최적—즉, $ \mathcal{M} $의 모든 환경에서 다른 정책가 가치를 초월하지 못함—인지 여부는?
  • RQ3에르고딕 마르코프 결정 과정(MDPs)에서 베이즈 혼합 정책 $ p^\xi $가 자기 최적화 행동을 달성할 수 있으며, 수렴 속도는 어떻게 되는가?
  • RQ4자기 최적화 정책가 존재하는 데 필요한 조건이, 베이즈 혼합 정책 $ p^\xi $가 자기 최적화임을 보장하는 데에도 충분한가?
  • RQ5무한 수명 할인 모델에서, 효과적 수명이 유계가 아닌 경우 $ p^\xi $의 성능는 어떻게 행동하는가?

주요 결과

  • 클래스 $ \mathcal{M} $에 대해 어떤 구조적 가정 없이도, 혼합 $ \xi $에 기반한 베이즈 최적 정책 $ p^\xi $는 파레토 최적이다.
  • 클래스 $ \mathcal{M} $가 적어도 하나의 자기 최적화 정책를 포함하면, $ p^\xi $는 자기 최적화임이 필요이고 충분하다.
  • 유한한 $ \mathcal{M} $에 대해, 평균 가치 $ \frac{1}{m} V_{1m}^{p^\xi \nu} $가 최적 가치 $ \frac{1}{m} V_{1m}^{*\nu} $로 수렴하는 속도는 최소 $ O(m^{-1/3}) $ 이상이다.
  • 할인율이 $ \gamma_{k+1}/\gamma_k \to 1 $을 만족하면, $ p^\xi $는 비할인 및 할인 무한 수명 모델 모두에서 에르고딕 MDPs에 대해 자기 최적화이다.
  • 이 결과는 효과적 수명이 유계가 아닌 에르고딕 MDPs에 대해 처음으로 순수하게 베이지안적이며 일관된 자기 최적화 정책를 제공하며, 이전 방법의 유한 수명 또는 기하 할인에 의존하는 한계를 극복한다.
  • 이 프레임워크는 연속적인 환경 클래스 $ \mathcal{M} $ (예: 유리수 전이 확률을 가진 에르고딕 MDPs)로 확장 가능하며, 약간의 정규성 조건이 있으면 결과는 그대로 유지된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.