Skip to main content
QUICK REVIEW

[论文解读] Intrinsically Motivated Acquisition of Modular Slow Features for Humanoids in Continuous and Non-Stationary Environments

Varun Raj Kompella, Laurenz Wiskott|arXiv (Cornell University)|Jan 17, 2017
Reinforcement Learning in Robotics参考文献 34被引用 3
一句话总结

本文提出 CD-MISFA 2.0,一种内在动机的在线学习系统,使类人机器人能够在连续、非平稳环境中,自主从未知的高维视觉输入中发现模块化、缓慢变化的特征。通过结合人工好奇心与增量慢特征分析,该方法动态选择下一个最易学习的感官流,利用自适应抽象门控机制稳定学习过程,实现无需先验标签或离散状态空间的鲁棒、顺序性多任务无关抽象特征获取。

ABSTRACT

A compact information-rich representation of the environment, also called a feature abstraction, can simplify a robot's task of mapping its raw sensory inputs to useful action sequences. However, in environments that are non-stationary and only partially observable, a single abstraction is probably not sufficient to encode most variations. Therefore, learning multiple sets of spatially or temporally local, modular abstractions of the inputs would be beneficial. How can a robot learn these local abstractions without a teacher? More specifically, how can it decide from where and when to start learning a new abstraction? A recently proposed algorithm called Curious Dr. MISFA addresses this problem. The algorithm is based on two underlying learning principles called artificial curiosity and slowness. The former is used to make the robot self-motivated to explore by rewarding itself whenever it makes progress learning an abstraction; the later is used to update the abstraction by extracting slowly varying components from raw sensory inputs. Curious Dr. MISFA's application is, however, limited to discrete domains constrained by a pre-defined state space and has design limitations that make it unstable in certain situations. This paper presents a significant improvement that is applicable to continuous environments, is computationally less expensive, simpler to use with fewer hyper parameters, and stable in certain non-stationary environments. We demonstrate the efficacy and stability of our method in a vision-based robot simulator.

研究动机与目标

  • 解决在连续、非平稳且部分可观测环境中学习多个空间或时间上局部化的、与任务无关的特征抽象的挑战。
  • 克服先前方法(如 Curious Dr. MISFA 1.0)的局限性,后者需要离散状态空间,并在动态环境中易出现不稳定现象。
  • 通过内在好奇心实现自我激励探索,驱动智能体在无外部奖励的情况下发现感官输入中下一个最易学习的规律性。
  • 开发一种计算效率高、稳定且超参数极少的系统,能够从原始图像流中在线学习抽象特征。

提出的方法

  • 智能体利用人工好奇心自我激励探索,通过奖励从高维感官输入中学习新且缓慢变化的特征的进展来实现。
  • 应用增量慢特征分析(IncSFA)提取捕捉感官数据中缓慢变化成分的时间抽象,其原理基于底层原因的变化速度慢于原始输入。
  • 门控机制通过监测抽象输出的变化速率来防止重复学习已获取的抽象;当变化速率低于阈值时,该抽象即被冻结。
  • 系统基于一种好奇心驱动的探索策略,动态选择下一个要探索的感官流,优先选择学习进展高且先前抽象度低的流。
  • 该方法使用连续动作空间(如头部旋转)访问不同视觉视角,生成多个高维观测流。
  • 超参数被最小化:仅 ν, τ, σ, 和 δ 需要调优,且算法在多次试验中表现出稳定性,无需预定义元类别或离散标签。

实验结果

研究问题

  • RQ1机器人是否能在无外部监督或预定义状态的情况下,于连续、非平稳环境中,从未知的原始视觉输入中自主发现多个模块化、与任务无关的特征抽象?
  • RQ2如何有效结合内在好奇心与增量慢特征分析,以在动态感官流中引导顺序性、稳定的抽象学习?
  • RQ3在感官输入非独立同分布、部分可观测且受时变环境因素影响的情况下,何种机制可实现可靠的抽象发现?
  • RQ4当从重叠或竞争性的感官流中学习多个抽象特征时,该系统在多大程度上能避免冗余学习并保持稳定性?

主要发现

  • 该算法成功学习了两个不同的抽象:一个编码物体-1 的 y 位置(在 0.4 和 0.6 处有两个稳定位置),另一个编码物体-3 的缓慢变化 y 位置,所有输入均为原始 128x48 灰度图像。
  • 在全部 10 次实验中,系统均收敛至最优策略,智能体首先学习较简单的抽象(物体-1),随后学习更复杂的抽象(物体-3),与学习难度度量的预测一致。
  • 第一个抽象 φ₁ 可靠地编码了物体-1 的双位置状态,对最后 200 个输出进行多项式拟合后,其结果与实际 y 位置高度匹配。
  • 第二个抽象 φ₂ 同样成功捕捉了物体-3 的缓慢变化 y 位置,证明了该方法从复杂视觉动态中提取有意义、低维表示的能力。
  • 系统未尝试学习第三个流(x₂),其动态呈现均匀随机性,证实算法能正确识别不可学习输入并避免无谓探索。
  • 自适应抽象门控机制成功防止了对已学习特征的重复学习,表现为 |ḋη| 降至 δ 以下,随后探索策略被重置。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。