[論文レビュー] Learning-Based Mean-Payoff Optimization in an Unknown MDP under Omega-Regular Constraints
本稿では、未知のマルコフ決定過程(MDP)において、平均報酬を最適化する学習ベースのアプローチを提示する。同時に、オメガ正則なパリティ目的の確実的またはほぼ確実的満たしを保証する。支持と最小遷移確率の境界が既知である条件下で、$\varepsilon$-最適な平均報酬を高い確率($1-\gamma$)で達成する有限記憶と無限記憶のオンライン学習戦略を提案。部分的に指定された環境における安全性と適応性を確保する。
We formalize the problem of maximizing the mean-payoff value with high probability while satisfying a parity objective in a Markov decision process (MDP) with unknown probabilistic transition function and unknown reward function. Assuming the support of the unknown transition function and a lower bound on the minimal transition probability are known in advance, we show that in MDPs consisting of a single end component, two combinations of guarantees on the parity and mean-payoff objectives can be achieved depending on how much memory one is willing to use. (i) For all $\\epsilon$ and $\\gamma$ we can construct an online-learning finite-memory strategy that almost-surely satisfies the parity objective and which achieves an $\\epsilon$-optimal mean payoff with probability at least $1 - \\gamma$. (ii) Alternatively, for all $\\epsilon$ and $\\gamma$ there exists an online-learning infinite-memory strategy that satisfies the parity objective surely and which achieves an $\\epsilon$-optimal mean payoff with probability at least $1 - \\gamma$. We extend the above results to MDPs consisting of more than one end component in a natural way. Finally, we show that the aforementioned guarantees are tight, i.e. there are MDPs for which stronger combinations of the guarantees cannot be ensured.
研究の動機と目的
- 未知の遷移確率と報酬を有するMDPにおいて、長期的平均報酬(平均報酬)を最大化する課題に対処すること。同時に、パリティ目的が満たされることを保証すること。
- 遷移確率のサポートが既知であり、最小遷移確率の下限($\pi_{\mathrm{min}}$)が与えられる部分的知識の下で、学習戦略を開発すること。
- 平均報酬最適性に確率的保証を提供するとともに、パリティ目的のほぼ確実的または確実的満たしを保証すること。
- 単一の終端成分(EC)から、複数のECを有するMDPへと結果を拡張し、安全性とパフォーマンスの保証を維持すること。
- 提案された保証がタイトであることを示す、すなわち一般にはより強い組み合わせは達成できないこと。
提案手法
- 探索を通じて未知の遷移確率と報酬関数をオンライン学習で推定し、$\varepsilon/4$-精度の近似を得る。高い確率($1-\gamma/2$)で達成する。
- 推定された遷移確率と報酬の統計的分析を用いて、高い平均報酬が達成可能な良い終端成分(GEC)を特定する。
- まず探索を行いMDPを推定する有限記憶戦略を構築し、その後、期待平均報酬が最大のGECに最適化された戦略に切り替える。
- 無限記憶戦略では、学習後にMDP構造を完全に把握できるため、パリティ目的の確実的満たしを保証しつつ、平均報酬を最適化する。
- 統計的集中限界(例:ホイーディングの不等式)を適用して、推定された遷移および報酬関数の信頼性を確保する。
- ほぼ確実なパリティ満たしの下での最高達成可能平均報酬を定義する基準値 $\mathbf{asVal}(Q,\alpha_T)$ を用い、$\varepsilon$-最適性の保証を可能にする。
実験結果
リサーチクエスチョン
- RQ1未知のMDPにおいて、支持と $\pi_{\mathrm{min}}$ が既知である条件下で、$\varepsilon$-最適な平均報酬を確率 $1-\gamma$ 以上で達成し、かつほぼ確実にパリティ目的を満たす戦略を学習可能か?
- RQ2無限記憶を用いることで、確実なパリティ目的の満たしを達成しつつ、$\varepsilon$-最適な平均報酬を高い確率で達成できるか?
- RQ3単一の終端成分から、複数の終端成分を有するMDPに、有限記憶学習戦略をどのように拡張できるか?同時に、安全性とパフォーマンスの保証を維持できるか?
- RQ4部分的情報下での未知のMDPにおいて、安全性(パリティ)とパフォーマンス(平均報酬)の保証を組み合わせる際の根本的限界は何か?
- RQ5提案された保証がタイトであることを示せるか?すなわち、一般にはより強い確率的およびほぼ確実/確実な保証の組み合わせは達成できないか?
主な発見
- すべての $\varepsilon, \gamma \in (0,1)$ に対して、有限記憶戦略が存在し、パリティ目的をほぼ確実に満たし、確率 $1-\gamma$ 以上で $\varepsilon$-最適な平均報酬を達成する。
- すべての $\varepsilon, \gamma \in (0,1)$ に対して、無限記憶戦略が存在し、パリティ目的を確実に満たし、確率 $1-\gamma$ 以上で $\varepsilon$-最適な平均報酬を達成する。
- 複数の終端成分を有するMDPに対しても、パリティに勝利する戦略とGEC最適化戦略を組み合わせることで、弱く良いMECごとに保証を維持できる。
- 提案された保証はタイトである。より強い安全性とパフォーマンスの保証の組み合わせが一般には達成できないMDPが存在する。
- 有限記憶で十分にほぼ確実なパリティ満たしを達成でき、この設定では無限記憶は安全性の保証を有限記憶より向上させない。
- 基準値 $\mathbf{asVal}(Q,\alpha_T)$ は、ほぼ確実なパリティ満たしの下での最高達成可能平均報酬をベンチマークとして提供し、$\varepsilon$-最適性の形式的分析を可能にする。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。