Skip to main content
QUICK REVIEW

[论文解读] Kinematic State Abstraction and Provably Efficient Rich-Observation Reinforcement Learning

Dipendra Misra, Mikael Henaff|arXiv (Cornell University)|Nov 13, 2019
Anomaly Detection Techniques and Applications被引用 13
一句话总结

该论文提出HOMER,一种强化学习算法,通过学习一种运动学状态抽象(将具有相同前向和后向动力学的观测分组)来实现在丰富观测环境中的可证明高效的探索。该方法交替进行表征学习与策略探索,实现了在潜在状态上的多项式样本复杂度,且不依赖于观测空间大小,在稀疏奖励、高维控制问题上优于基线方法。

ABSTRACT

We present an algorithm, HOMER, for exploration and reinforcement learning in rich observation environments that are summarizable by an unknown latent state space. The algorithm interleaves representation learning to identify a new notion of kinematic state abstraction with strategic exploration to reach new states using the learned abstraction. The algorithm provably explores the environment with sample complexity scaling polynomially in the number of latent states and the time horizon, and, crucially, with no dependence on the size of the observation space, which could be infinitely large. This exploration guarantee further enables sample-efficient global policy optimization for any reward function. On the computational side, we show that the algorithm can be implemented efficiently whenever certain supervised learning problems are tractable. Empirically, we evaluate HOMER on a challenging exploration problem, where we show that the algorithm is exponentially more sample efficient than standard reinforcement learning baselines.

研究动机与目标

  • 解决在高维、丰富观测环境中标准强化学习因统计不可行性而面临高效探索挑战的问题。
  • 开发一种从原始观测中学习紧凑潜在状态表征的方法,而无需对潜在状态空间的结构有先验知识。
  • 通过结合表征学习与策略探索,实现对任意奖励函数的样本高效策略优化。
  • 实现可证明的样本复杂度界,其规模随潜在状态数和时域长度呈多项式增长,但与观测空间大小无关。
  • 设计一种计算高效的算法,通过归约到可处理的监督学习问题来实现。

提出的方法

  • HOMER学习一种新颖的状态抽象——运动学不可分性,即若观测具有相同的前向和后向动力学,则将其分组。
  • 通过在原始观测上构建对比估计问题,训练一个瓶颈回归器以识别运动学不可分的状态。
  • 通过将探索问题归约为上下文Bandits问题,构建策略覆盖,利用合成奖励函数激励访问每个抽象状态。
  • 以迭代、归纳的方式交替进行表征学习与策略学习:粗粒度抽象下的策略生成新经验,从而细化抽象。
  • 该方法依赖两个核心组件:用于状态抽象的表征头(REG)和用于探索策略学习的上下文Bandits策略(CB)。
  • 其运行基于归约框架,当底层监督学习问题可处理时,可保证计算效率。

实验结果

研究问题

  • RQ1我们能否在缺乏潜在结构先验知识的前提下,从丰富观测环境中原始观测中学习到紧凑且信息丰富的状态抽象?
  • RQ2我们能否设计一种可证明高效的探索策略,避免对观测空间大小的依赖?
  • RQ3在复杂、高维环境中,表征与探索的交替学习是否能带来更好的样本效率?
  • RQ4所学习的抽象是否能支持对任意奖励函数的样本高效策略优化?
  • RQ5所提出的运动学状态抽象是否足以实现相比标准强化学习基线的指数级样本效率提升?

主要发现

  • HOMER实现的样本复杂度在潜在状态数、动作数、时域长度和函数类复杂度上呈多项式增长,且不显式依赖于观测空间大小。
  • 在最优奖励概率为10^-100的恶魔组合锁问题中,HOMER始终能找到近似最优策略,而基线方法则失败。
  • HOMER优于使用朴素探索、内在好奇心(RND)以及先前工作中提出的PAC-RL算法的标准强化学习基线。
  • 该算法在不同时域长度(H ∈ {6, 12, 25})下表现稳健,样本效率始终具有显著优势。
  • 所学习的运动学状态抽象成功捕捉了环境的潜在结构,从而支持有效的探索与策略学习。
  • 实证结果证实,对比表征学习与通过上下文Bandits构建策略覆盖的结合,显著提升了样本效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。