[論文レビュー] Self-Optimizing and Pareto-Optimal Policies in General Environments based on Bayes-Mixtures
本稿は、一般の確率的環境においてパレート最適かつ自己最適化可能な方策を導出するためのベイズ強化学習フレームワークを提案する。混合分布 $ \xi $ に基づくベイズ最適方策 $ p^\xi $ が、クラス $ \mathcal{M} $ に自己最適化可能な方策が存在する場合に限り自己最適化可能であることを証明しており、有効なホライズンが非有界なエルゴディック・マークフ・意思決定過程(MDP)に対して、最初の完全にベイズ的で一貫性があり、自己最適化可能な方策を提供する。
The problem of making sequential decisions in unknown probabilistic environments is studied. In cycle $t$ action $y_t$ results in perception $x_t$ and reward $r_t$, where all quantities in general may depend on the complete history. The perception $x_t$ and reward $r_t$ are sampled from the (reactive) environmental probability distribution $μ$. This very general setting includes, but is not limited to, (partial observable, k-th order) Markov decision processes. Sequential decision theory tells us how to act in order to maximize the total expected reward, called value, if $μ$ is known. Reinforcement learning is usually used if $μ$ is unknown. In the Bayesian approach one defines a mixture distribution $ξ$ as a weighted sum of distributions $ν\in\M$, where $\M$ is any class of distributions including the true environment $μ$. We show that the Bayes-optimal policy $p^ξ$ based on the mixture $ξ$ is self-optimizing in the sense that the average value converges asymptotically for all $μ\in\M$ to the optimal value achieved by the (infeasible) Bayes-optimal policy $p^μ$ which knows $μ$ in advance. We show that the necessary condition that $\M$ admits self-optimizing policies at all, is also sufficient. No other structural assumptions are made on $\M$. As an example application, we discuss ergodic Markov decision processes, which allow for self-optimizing policies. Furthermore, we show that $p^ξ$ is Pareto-optimal in the sense that there is no other policy yielding higher or equal value in {\em all} environments $ν\in\M$ and a strictly higher value in at least one.
研究の動機と目的
- 未知の確率的環境で動作する合理的なエージェントの一般フレームワークを、ベイズ混合モデルを用いて構築すること。
- クラス $ \mathcal{M} $ に属するすべての環境で漸近的最適性(自己最適化)を達成するベイズ最適方策 $ p^\xi $ の条件を確立すること。
- クラス $ \mathcal{M} $ に対して追加の構造的仮定を課さずに、$ p^\xi $ がパレート最適であること——つまり、$ \mathcal{M} $ 内のすべての環境で他の方策が $ p^\xi $ を支配できないこと——を証明すること。
- エルゴディック・マークフ意思決定過程(MDP)において自己最適化可能な方策が存在することを示し、ベイズ最適方策 $ p^\xi $ がこの性質を達成することを証明すること。
- ベイズ強化学習に関する既存の結果を統合・拡張し、自己最適化可能な方策が存在するための必要条件が、ベイズ混合方策 $ p^\xi $ が自己最適化可能であるための十分条件であることを示すこと。
提案手法
- 行動が知的感知と報酬に従って確率的分布 $ \mu $ に従って決定される一般環境モデルを定義し、非マルコフ的かつ部分的に観測可能なプロセスを許容する。
- 既知の環境クラス $ \mathcal{M} $ に対して、事前重み $ w_\nu $ を用いて、真の $ \mu $ を含む混合分布 $ \xi = \sum_{\nu \in \mathcal{M}} w_\nu \nu $ を構築する。
- 混合分布 $ \xi $ における期待値 $ V_\xi^p $ を最大化する方策としてベイズ最適方策 $ p^\xi $ を定義し、混合値の線形性と凸性を活用する。
- パレート最適性を証明:$ \mathcal{M} $ 内のすべての $ \nu $ で、他の方策が $ p^\xi $ よりも高いまたは同等の価値を達成し、少なくとも一つの環境で厳密に高い価値を達成することはできない。
- 自己最適化収束性を確立:$ \mathcal{M} $ に自己最適化可能な方策が存在する限り、すべての $ \nu \in \mathcal{M} $ に対して $ m \to \infty $ のとき $ \frac{1}{m} V_{1m}^{p^\xi \nu} \to \frac{1}{m} V_{1m}^{*\nu} $ が成り立つ。
- 無限ホライズンの割引モデル($ \gamma_{k+1}/\gamma_k \to 1 $ を満たすもの)に拡張し、割引価値が最適価値に収束することを示す。
実験結果
リサーチクエスチョン
- RQ1クラス $ \mathcal{M} $ のすべての環境において、ベイズ最適方策 $ p^\xi $ が自己最適化可能となる条件は何か?
- RQ2クラス $ \mathcal{M} $ に対して追加の仮定を課さずに、ベイズ最適方策 $ p^\xi $ がパレート最適($ \mathcal{M} $ 内のすべての環境で他の方策が支配できない)であるか?
- RQ3エルゴディック・マークフ意思決定過程(MDP)において、ベイズ混合方策 $ p^\xi $ は自己最適化行動を達成可能か?収束速度は?
- RQ4自己最適化可能な方策が存在するための必要条件が、ベイズ混合方策 $ p^\xi $ が自己最適化可能であるための十分条件であるか?
- RQ5有効ホライズンが非有界な無限ホライズン割引モデル下で、$ p^\xi $ の性能はどのように振る舞うか?
主な発見
- クラス $ \mathcal{M} $ に対して任意の構造的仮定を課さずに、$ \mathcal{M} $ 内の環境の混合 $ \xi $ に基づくベイズ最適方策 $ p^\xi $ は、常にパレート最適である。
- 方策 $ p^\xi $ が自己最適化可能であるのは、クラス $ \mathcal{M} $ に少なくとも一つの自己最適化可能な方策が存在する場合に限る——この必要条件は十分条件でもある。
- 有限な $ \mathcal{M} $ の場合、平均価値 $ \frac{1}{m} V_{1m}^{p^\xi \nu} $ から最適価値 $ \frac{1}{m} V_{1m}^{*\nu} $ への収束速度は、少なくとも $ O(m^{-1/3}) $ 以上である。
- 割引係数が $ \gamma_{k+1}/\gamma_k \to 1 $ を満たす限り、アンディスcountedおよびディスカウントド両方の無限ホライズンモデルにおいて、方策 $ p^\xi $ はエルゴディック MDP に対して自己最適化可能である。
- 本結果により、有効ホライズンが非有界なエルゴディック MDP に対して、最初の完全にベイズ的で一貫性があり、自己最適化可能な方策が確立された。これは、有限ホライズンや幾何的割引に依存する従来の手法の限界を克服する。
- 本フレームワークは、連続的クラス $ \mathcal{M} $ の環境(例えば、有理数遷移確率をもつエルゴディック MDP)に拡張可能であり、やや厳しい正則性条件のもとでも、結果は有効である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。