[論文レビュー] Learning Non-Markovian Reward Models in MDPs
本論文は、マークフ・決定過程(MDPs)における非マルコフ的報酬をモデル化する有限オートマトンであるメーリ報酬マシン(MRMs)を推論するためにアングルンのL*アルゴリズムを用いるアクティブラーニングフレームワークを提案する。この手法はオートマトン推論とMDP最適化を組み合わせ、履歴依存報酬を学習・活用するもので、玩具的なMRM例において数秒以内に完全な学習を達成し、やや厳しい仮定のもとで形式的保証を有する。
There are situations in which an agent should receive rewards only after having accomplished a series of previous tasks. In other words, the reward that the agent receives is non-Markovian. One natural and quite general way to represent history-dependent rewards is via a Mealy machine; a finite state automaton that produces output sequences (rewards in our case) from input sequences (state/action observations in our case). In our formal setting, we consider a Markov decision process (MDP) that models the dynamic of the environment in which the agent evolves and a Mealy machine synchronised with this MDP to formalise the non-Markovian reward function. While the MDP is known by the agent, the reward function is unknown from the agent and must be learnt. Learning non-Markov reward functions is a challenge. Our approach to overcome this challenging problem is a careful combination of the Angluin's L* active learning algorithm to learn finite automata, testing techniques for establishing conformance of finite model hypothesis and optimisation techniques for computing optimal strategies in Markovian (immediate) reward MDPs. We also show how our framework can be combined with classical heuristics such as Monte Carlo Tree Search. We illustrate our algorithms and a preliminary implementation on two typical examples for AI.
研究の動機と目的
- 報酬が現在の状態だけでなく、状態/行動の履歴に依存する非マルコフ的報酬関数をMDPで学ぶという課題に対処すること。
- 即時のマルコフ的報酬に依存する従来のMDPの限界を克服すること。これは、複雑な順序依存タスクを捉えることができない。
- 環境との相互作用から、真の報酬関数に対して適合する報酬マシン構造を形式的かつ保証付きで推論する手法を開発すること。
- オートマトン学習と標準的なMDP解法技術を組み合わせることで、非マルコフ的報酬のもとでの最適方策合成を可能にすること。
- 形式的検証と実験的評価を通じて、実用的AI例における手法の実現可能性と正しさを示すこと。
提案手法
- 非マルコフ的報酬を、状態/行動の系列を報酬に写像する有限状態オートマトンとしてモデル化するMealy報酬マシン(MRMs)を用いる。
- 状態/行動の観測に対するメンバーーシップクエリと同値クエリを用いて、アングルンのL*アクティブラーニングアルゴリズムを適用し、MRM構造を推論する。
- 仮説されたMRMが真の報酬関数と適合しているかを検証するための形式的テスト手法を用いる。
- 学習されたMRMをMDPに統合し、標準的なマルコフ的MDPソルバー(例:価値反復、方策反復)を用いて最適方策を計算する。
- スケーラブルな展開を実現するため、モンテカルロツリー探索(MCTS)などの古典的計画手法とフレームワークを統合する。
- 実用的なパイプラインを実装し、エージェントがランダムな探索でデータを収集し、その後L*を用いてMRM構造を推論し、方策を最適化する。
実験結果
リサーチクエスチョン
- RQ1形式的オートマトン推論を用いて、MDPにおける非マルコフ的報酬関数をアクティブかつ正確に学習できるか?
- RQ2学習されたMRMは、最適方策を導出するためにMDP計画にどのように効果的に統合できるか?
- RQ3履歴依存報酬を持つ実用的環境において、MRMの学習のサンプル効率および時間効率はどの程度か?
- RQ4MCTSなどの既存の計画アルゴリズムとフレームワークを統合することで、より大きな問題にスケーラブルに適用できるか?
- RQ5L*アルゴリズムが、下位のMRM構造を正しく推論できる条件は何か?
主な発見
- 提案されたフレームワークは、Cookie Domainの例において、1回の試行あたり約1秒で完璧なMRMを学習し、10回の試行すべてで100%の正確性を達成した。
- Cookie Domainにおいて、APF(アクティブ方策フレームワーク)設定下で、エージェントは$1459 \pm 376$のリターンを達成し、平均して174 \pm 59秒の訓練時間を要した。
- すべての実験走行において、MRM構造が正しく推論された。これは、非マルコフ的報酬に対するアクティブラーニングの実現可能性を示している。
- フレームワークはMCTSやその他の古典的ヒューリスティクスと統合可能であり、複雑な環境におけるスケーラブルな方策学習を可能にする。
- L*の理論的基盤を活用することで、やや厳しい仮定のもとでMRM推論の正しさと完全性に関する形式的保証を提供する。
- 結果から、MRMは、EVバッテリー生産における危険なアセンブリシーケンスを避けるなど、標準的な即時報酬では表現できない複雑な順序依存報酬をモデル化できることを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。