[论文解读] Mutual Information Maximization for Robust Plannable Representations
MIRO 提出了一种互信息最大化方法,用于在基于模型的强化学习中学习鲁棒且可规划的潜在表征。通过使用噪声对比估计器优化潜在状态与未来观测之间的互信息,该方法在视觉干扰物和杂乱场景中相比基于重建的方法展现出更优的鲁棒性,同时在标准控制基准测试中保持了强劲的性能。
Extending the capabilities of robotics to real-world complex, unstructured environments requires the need of developing better perception systems while maintaining low sample complexity. When dealing with high-dimensional state spaces, current methods are either model-free or model-based based on reconstruction objectives. The sample inefficiency of the former constitutes a major barrier for applying them to the real-world. The later, while they present low sample complexity, they learn latent spaces that need to reconstruct every single detail of the scene. In real environments, the task typically just represents a small fraction of the scene. Reconstruction objectives suffer in such scenarios as they capture all the unnecessary components. In this work, we present MIRO, an information theoretic representational learning algorithm for model-based reinforcement learning. We design a latent space that maximizes the mutual information with the future information while being able to capture all the information needed for planning. We show that our approach is more robust than reconstruction objectives in the presence of distractors and cluttered scenes
研究动机与目标
- 解决无模型强化学习的样本效率低下问题,以及基于重建的模型化强化学习中对无关细节的过拟合问题。
- 学习一个仅捕捉与任务相关动态的潜在空间,摒弃高维观测中的噪声和干扰物。
- 通过信息论表征学习提升在存在视觉杂乱和干扰的真实世界环境中的鲁棒性。
- 开发一种方法,在保持视觉噪声下规划性能的同时实现样本效率。
- 证明互信息最大化相比重建目标可产生更鲁棒且泛化能力更强的表征。
提出的方法
- 该方法优化潜在状态与未来观测之间互信息的噪声对比估计器(NCE)下界。
- 使用基于能量的模型以避免分布假设,并实现潜在表征的判别式训练。
- 潜在空间与预测模型、奖励预测器及过滤函数通过端到端训练联合学习。
- 对潜在转移模型应用重参数化技巧,以实现可微采样和反向传播。
- 使用基于交叉熵方法的模型预测控制(MPC-CEM)进行规划,结合在线数据收集与模型重训练。
- NCE目标中的负样本从一批未来观测中采样,以估计互信息。
实验结果
研究问题
- RQ1在存在视觉干扰物的情况下,互信息最大化是否能产生比基于重建的目标更鲁棒的潜在表征?
- RQ2与最先进基于重建的方法相比,MIRO在样本效率和渐近性能方面表现如何?
- RQ3环境中引入视觉噪声是否提升或降低MIRO和基于重建模型的性能?
- RQ4当场景中存在杂乱和无关物体时,MIRO能否学习到仅捕捉与任务相关动态的潜在空间?
- RQ5最大化潜在状态与未来观测之间的互信息是否能提升在非结构化环境中的规划性能?
主要发现
- 在存在干扰物(如随机放置的红色球体和绿色立方体)的情况下,MIRO保持或提升了性能,而基于重建的方法(如PlaNet)性能显著下降。
- 在Cheetah环境中,MIRO的性能随视觉噪声增加而提升,表明干扰物有助于模型聚焦于与任务相关的特征。
- 在Cartpole Balance环境中,PlaNet在干扰物存在时无法有效学习,而MIRO实现了稳定且成功的训练。
- 在无干扰物的情况下,MIRO在所有四个基准环境(CartPole、Reacher、Finger 和 Half Cheetah)中达到或超过PlaNet的渐近性能。
- 基于NCE的互信息目标使潜在空间更具鲁棒性,能够摒弃无关的视觉细节和噪声。
- 潜在表征与预测模型的联合优化,显著提升了在类似真实世界环境中的规划鲁棒性与样本效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。