[论文解读] Self-supervised Visual Reinforcement Learning with Object-centric Representations
该论文提出SMORL,一种自监督视觉强化学习框架,利用组合生成世界模型(SCALOR)的物体中心表征,在多物体环境中发现并学习可重用技能。通过利用结构化、解耦的物体表征以及目标条件注意力策略,SMORL在多物体重排等复杂组合任务上表现优异,即使仅使用图像观测且无真实监督信号,仍优于基于VAE的基线方法。
Autonomous agents need large repertoires of skills to act reasonably on new tasks that they have not seen before. However, acquiring these skills using only a stream of high-dimensional, unstructured, and unlabeled observations is a tricky challenge for any autonomous agent. Previous methods have used variational autoencoders to encode a scene into a low-dimensional vector that can be used as a goal for an agent to discover new skills. Nevertheless, in compositional/multi-object environments it is difficult to disentangle all the factors of variation into such a fixed-length representation of the whole scene. We propose to use object-centric representations as a modular and structured observation space, which is learned with a compositional generative world model. We show that the structure in the representations in combination with goal-conditioned attention policies helps the autonomous agent to discover and learn useful skills. These skills can be further combined to address compositional tasks like the manipulation of several different objects.
研究动机与目标
- 解决在仅使用非结构化视觉观测的情况下,于多物体组合环境中学习有用且通用技能的挑战。
- 通过利用结构化、解耦的物体中心表征,而非固定长度的VAE潜在变量,提升视觉强化学习中的样本效率与探索能力。
- 实现在无人类提供奖励函数或真实标注的情况下,自主发现目标并学习技能。
- 评估物体中心表征是否能提升视觉强化学习在分布外泛化与组合任务求解方面的能力。
提出的方法
- 该方法采用SCALOR架构,从原始图像观测中学习物体中心表征,将场景分解为离散、结构化的实体。
- 训练目标条件注意力策略,根据当前观测和目标表征选择动作,实现目标条件控制。
- 训练期间,目标表征从初始观测的表征中条件采样,使智能体能够探索多样化目标。
- 推理阶段,外部目标图像被编码为候选目标表征,智能体依次选择最匹配的目标进行执行。
- 该方法使用源自物体中心潜在空间结构的自监督奖励信号,避免依赖密集或稀疏的奖励塑造。
- 该框架整合了生成世界模型,联合学习场景分解与表征,提升数据效率与迁移能力。
实验结果
研究问题
- RQ1通过组合生成模型学习到的物体中心表征,是否能提升多物体视觉环境中的技能发现与强化学习性能?
- RQ2SMORL在样本效率与复杂组合任务性能方面,相较于基于VAE的自监督强化学习方法表现如何?
- RQ3SMORL智能体在测试时面对与训练阶段不同物体数量的环境,其泛化能力如何?
- RQ4与标准VAE方法相比,使用结构化、解耦表征是否能带来更好的分布外泛化能力?
主要发现
- 在多物体视觉重排环境中,SMORL显著优于RIG与Skew-Fit,证明了物体中心表征在复杂任务中的优势。
- 在更简单的多物体视觉推动环境中,SMORL性能与最佳基线相当,表明其在不同任务复杂度下的鲁棒性。
- 在两物体重排任务上进行训练后,SMORL智能体在单物体测试环境中表现出有效泛化,性能接近在单物体上预训练的智能体。
- 尽管结果表现强劲,SMORL在使用真实表征的SAC上仍表现欠佳,表明SCALOR在遮挡处理与表征噪声方面存在局限。
- 该方法表明,物体中心表征支持已学习子任务的顺序执行,使智能体能够通过组合技能解决复杂组合目标。
- SCALOR的训练计算成本高于VAE,但推理开销较低,使该方法在预训练后具备良好的可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。