[论文解读] ROLL: Visual Self-Supervised Reinforcement Learning with Object Reasoning
ROLL 提出了一种视觉自监督强化学习框架,通过结合基于LSTM的时间建模与对比匹配损失,实现对象推理,从而增强对物体遮挡的鲁棒性。通过利用遮挡前后帧在潜在空间中的匹配,ROLL在85%像素遮挡下实现了仅1厘米的平均估计误差,显著优于未使用匹配损失或物体-VAE的基线方法。
Current image-based reinforcement learning (RL) algorithms typically operate on the whole image without performing object-level reasoning. This leads to inefficient goal sampling and ineffective reward functions. In this paper, we improve upon previous visual self-supervised RL by incorporating object-level reasoning and occlusion reasoning. Specifically, we use unknown object segmentation to ignore distractors in the scene for better reward computation and goal generation; we further enable occlusion reasoning by employing a novel auxiliary loss and training scheme. We demonstrate that our proposed algorithm, ROLL (Reinforcement learning with Object Level Learning), learns dramatically faster and achieves better final performance compared with previous methods in several simulated visual control tasks. Project video and code are available at https://sites.google.com/andrew.cmu.edu/roll.
研究动机与目标
- 在部分可观测环境下,特别是物体遮挡情况下,提升视觉表示学习的性能。
- 使智能体即使在视觉输入中部分被遮挡时,也能对物体位置进行推理。
- 开发一种无需人工标注监督或奖励塑形的自监督框架。
- 评估基于LSTM的序列建模与对比匹配损失相结合在视觉推理中的有效性。
- 在不依赖显式物体检测的前提下,展示在复杂操作任务中对遮挡的鲁棒性。
提出的方法
- 使用场景-VAE从RGB观测中学习环境的解耦视觉表示。
- 使用物体-VAE学习单个物体的解耦表示,并在预训练期间应用合成遮挡。
- 引入LSTM网络以建模物体状态的时间动态,训练时使用自编码器损失和匹配损失。
- 在潜在空间中,对遮挡帧的潜在嵌入与最近邻未遮挡帧之间应用对比匹配损失。
- 使用背景减除模块(通过OpenCV的BackgroundSubtractorMOG2实现)以分离运动物体,并使用机器人分割网络排除机器人本身对前景检测的干扰。
- 采用两阶段训练流程:先在合成轨迹上进行预训练,随后在强化学习训练期间通过倾斜回放缓冲区进行在线微调,联合训练LSTM与物体-VAE。
实验结果
研究问题
- RQ1通过结合物体推理的自监督视觉表示学习,能否提升视觉强化学习中对物体遮挡的鲁棒性?
- RQ2基于LSTM的时间建模与对比匹配损失的结合,如何影响遮挡条件下的估计精度?
- RQ3匹配损失系数对不同遮挡水平任务的学习性能有何影响?
- RQ4ROLL与SOTA方法(如Skew-Fit)相比,在操作精度与遮挡泛化能力方面表现如何?
- RQ5模型在遮挡条件下对物体位置的推理能力,在多大程度上依赖于LSTM与匹配损失的融合?
主要发现
- 在85%合成遮挡条件下,ROLL预测真实滑块位置的平均估计误差仅为1厘米,显著优于无匹配损失的LSTM(2.2厘米)和物体-VAE(3.1厘米)。
- 在所有测试的遮挡场景中,带有匹配损失的LSTM均能成功检索到正确的未遮挡帧,如附录图所示。
- 在高度遮挡任务(如Hurdle-Top Puck Pushing)中,模型对VAE匹配损失系数最为敏感,较高系数可提升性能。
- 在低遮挡任务(如Hurdle-Bottom Puck Pushing)中,过高的VAE匹配损失系数会轻微降低性能,表明需要针对任务进行超参数调优。
- ROLL对LSTM匹配损失系数的变化具有鲁棒性,在不同系数下均表现出一致的性能。
- 策略可视化显示,ROLL在精确物体定位任务中与目标状态的对齐效果优于Skew-Fit,尤其在需要高精度定位的任务中表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。