[论文解读] Learning Non-Markovian Reward Models in MDPs
本文提出了一种主动学习框架,利用Angluin的L*算法推断马尔可夫决策过程(MDPs)中的Mealy奖励机器(MRMs)——一种建模非马尔可夫奖励的有限自动机。该方法将自动机推断与MDP优化相结合,以学习并利用依赖历史的奖励,在数秒内完美学习玩具MRM示例,并在温和假设下提供形式化保证。
There are situations in which an agent should receive rewards only after having accomplished a series of previous tasks. In other words, the reward that the agent receives is non-Markovian. One natural and quite general way to represent history-dependent rewards is via a Mealy machine; a finite state automaton that produces output sequences (rewards in our case) from input sequences (state/action observations in our case). In our formal setting, we consider a Markov decision process (MDP) that models the dynamic of the environment in which the agent evolves and a Mealy machine synchronised with this MDP to formalise the non-Markovian reward function. While the MDP is known by the agent, the reward function is unknown from the agent and must be learnt. Learning non-Markov reward functions is a challenge. Our approach to overcome this challenging problem is a careful combination of the Angluin's L* active learning algorithm to learn finite automata, testing techniques for establishing conformance of finite model hypothesis and optimisation techniques for computing optimal strategies in Markovian (immediate) reward MDPs. We also show how our framework can be combined with classical heuristics such as Monte Carlo Tree Search. We illustrate our algorithms and a preliminary implementation on two typical examples for AI.
研究动机与目标
- 解决在MDPs中学习非马尔可夫奖励函数的挑战,其中奖励依赖于状态/动作历史,而不仅当前状态。
- 克服传统MDPs依赖即时、马尔可夫奖励的局限性,后者无法捕捉复杂、序列依赖的任务。
- 开发一种形式化、可保证的方法,从与环境的交互中推断潜在的奖励机器结构。
- 通过将自动机学习与标准MDP求解技术相结合,实现在非马尔可夫奖励下的最优策略合成。
- 通过形式化验证和实证评估,在实际AI示例中证明该方法的可行性与正确性。
提出的方法
- 使用Mealy奖励机器(MRMs)表示非马尔可夫奖励,MRMs通过有限状态自动机将状态-动作序列映射到奖励。
- 应用Angluin的L*主动学习算法,通过状态-动作观测的成员资格查询和等价性查询推断MRM结构。
- 使用形式化测试技术验证假设的MRMs与真实奖励函数的符合性。
- 将学习到的MRM集成到MDP中,使用标准马尔可夫MDP求解器(如值迭代、策略迭代)计算最优策略。
- 将该框架与经典规划技术(如蒙特卡洛树搜索,MCTS)结合,实现可扩展的部署。
- 实现一个实用的流水线:代理执行随机探索以收集数据,然后使用L*推断MRM结构并优化策略。
实验结果
研究问题
- RQ1能否通过形式化自动机推断,在MDPs中主动且正确地学习非马尔可夫奖励函数?
- RQ2如何将学习到的MRM有效集成到MDP规划中以推导最优策略?
- RQ3在具有历史依赖奖励的实际环境中,学习MRMs的样本效率和时间效率如何?
- RQ4该框架能否与MCTS等现有规划算法结合,以扩展到更大规模问题?
- RQ5在何种条件下,L*算法能够保证正确推断出底层MRM结构?
主要发现
- 在Cookie Domain示例中,所提出的框架在每轮试验约1秒内成功学习到完美MRM,十轮试验中准确率达100%。
- 在Cookie Domain中,代理在APF(主动策略框架)设置下获得$1459 \pm 376$的回报,平均训练时间为$174 \pm 59$秒。
- 该方法在所有实验运行中均正确推断出MRM结构,证明了主动学习在非马尔可夫奖励中的可行性。
- 该框架支持与MCTS及其他经典启发式方法的集成,实现在复杂环境中可扩展的策略学习。
- 该方法在温和假设下提供了MRM推断的正确性与完备性形式化保证,依托L*的理论基础。
- 结果表明,MRMs能够建模复杂、序列依赖的奖励(如电动汽车电池生产中避免危险装配序列),而这些是标准即时奖励无法表达的。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。