[论文解读] Unsupervised Real-Time Control through Variational Empowerment
本文提出了一种变分推断方法,以高效计算赋能(empowerment)的下界,从而实现在连续动力系统中的实时、无监督策略学习。通过利用深度变分贝叶斯滤波器进行端到端的动力学建模,该方法训练出能够最大化智能体对未来状态影响的策略,从而在模拟环境中产生鲁棒的、无目标导向的行为,如平衡与运动分布。
We introduce a methodology for efficiently computing a lower bound to empowerment, allowing it to be used as an unsupervised cost function for policy learning in real-time control. Empowerment, being the channel capacity between actions and states, maximises the influence of an agent on its near future. It has been shown to be a good model of biological behaviour in the absence of an extrinsic goal. But empowerment is also prohibitively hard to compute, especially in nonlinear continuous spaces. We introduce an efficient, amortised method for learning empowerment-maximising policies. We demonstrate that our algorithm can reliably handle continuous dynamical systems using system dynamics learned from raw data. The resulting policies consistently drive the agents into states where they can use their full potential.
研究动机与目标
- 为解决在高维、连续、非线性动力系统中计算赋能的挑战,标准方法在计算上不可行。
- 开发一种摊销化、可微分的方法,利用变分推断估计赋能的下界,从而实现实时策略优化。
- 证明赋能可作为无监督目标,从原始数据中学习出直观的、无目标导向的行为。
- 在复杂控制任务(如摆杆倒立、多球动力学、双足平衡)上验证该方法,使用学习到的系统模型进行测试。
提出的方法
- 该方法将赋能表述为动作与后继状态之间的最大互信息,并使用变分下界使连续系统中的计算变得可行。
- 采用深度变分贝叶斯滤波器(DVBF)从原始观测中学习可微分的、非线性的环境动力学模型。
- 通过重参数化梯度,使用随机梯度下降训练随机策略网络,以最大化赋能的变分下界。
- 通过在不同状态间共享参数来摊销推断,实现在部署过程中快速、恒定时间的策略评估。
- 通过在时间范围内累积单步赋能值,支持n步赋能,提升稳定性和长期影响能力。
- 该框架具备端到端可微性,支持从原始感官数据中联合学习动力学模型与赋能最大化策略。
实验结果
研究问题
- RQ1能否在高维、连续的动力系统中高效计算并优化赋能的变分下界?
- RQ2赋能能否作为自监督目标,诱导复杂控制任务中具有意义的、无目标导向的行为?
- RQ3当动力学从数据中学习时,该方法在非马尔可夫系统中是否具有泛化能力?
- RQ4与单步赋能相比,n步赋能如何影响稳定、高影响力策略的形成?
- RQ5该方法能否在无需外部奖励信号的情况下实现适用于机器人部署的实时性能?
主要发现
- 该方法成功学习到使智能体进入高赋能状态(如摆杆和双足的直立平衡)的策略,且完全不依赖奖励函数。
- 在多球环境中,通过赋能学习到的策略自然地将小球分布在盒子中,避免聚集,最大化可控性。
- 双足行走者所学习到的策略实现了稳定的平衡行为,尽管原始环境为实现相同任务使用了密集奖励塑造。
- 5步赋能的设定产生了平滑且单调递增的赋能曲线,其趋势与单步赋能的分布高度一致。
- 该方法实现了恒定时间的推理与策略评估,具备实时性能,适用于在线控制应用。
- 实证结果表明,赋能的变分下界是真实赋能的强代理,可在复杂非线性系统中有效支持策略优化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。