[论文解读] Acceleration of Actor-Critic Deep Reinforcement Learning for Visual Grasping in Clutter by State Representation Learning Based on Disentanglement of a Raw Input Image
该论文提出了一种基于原始RGB图像解耦的联合表示学习(SRL)方法,以加速视觉抓取任务中基于离策略演员-评论家深度强化学习(RL)的训练。通过将原始图像预处理为解耦成分——分离物体身份、位置及其他因素——该方法即使在稀疏奖励和多样化未见物体的情况下,也能实现高效抓取策略学习,在使用FM+AE与L3解耦的仿真环境中实现了71.9%的成功率。
For a robotic grasping task in which diverse unseen target objects exist in a cluttered environment, some deep learning-based methods have achieved state-of-the-art results using visual input directly. In contrast, actor-critic deep reinforcement learning (RL) methods typically perform very poorly when grasping diverse objects, especially when learning from raw images and sparse rewards. To make these RL techniques feasible for vision-based grasping tasks, we employ state representation learning (SRL), where we encode essential information first for subsequent use in RL. However, typical representation learning procedures are unsuitable for extracting pertinent information for learning the grasping skill, because the visual inputs for representation learning, where a robot attempts to grasp a target object in clutter, are extremely complex. We found that preprocessing based on the disentanglement of a raw input image is the key to effectively capturing a compact representation. This enables deep RL to learn robotic grasping skills from highly varied and diverse visual inputs. We demonstrate the effectiveness of this approach with varying levels of disentanglement in a realistic simulated environment.
研究动机与目标
- 解决在稀疏奖励和复杂视觉输入下,基于视觉的机器人抓取任务中离策略演员-评论家强化学习的样本效率低下和训练不稳定问题。
- 探究从原始图像中进行解耦表示学习是否能提升深度强化学习在复杂场景中抓取多样化未见物体的性能。
- 证明视觉输入的解耦——如分离物体身份和位置等独立生成因素——可为强化学习提供更紧凑且信息量更高的状态表征。
- 在真实仿真环境中评估不同SRL模型(如VAE、SAE、FM+AE)在不同解耦程度下的有效性。
- 建立一种框架:使用预训练的SRL模型初始化强化学习训练,相比联合SRL-RL训练,可提升收敛速度与最终性能。
提出的方法
- 在将图像输入SRL模型前,采用三级解耦方案(L0:原始图像,L1:物体级分离,L3:完全解耦身份、位置、尺度、光照和颜色)处理原始RGB图像。
- 在解耦图像表征上训练多种SRL模型——去噪自编码器(SAE)、变分自编码器(VAE)、β-VAE以及特征掩码自编码器(FM+AE)——以学习紧凑且解耦的潜在状态。
- 利用预训练的SRL模型提取状态表征,供后续离策略演员-评论家强化学习(DDPG和D4PG)使用,实现表示学习与策略学习的解耦。
- 通过设置较小的β值(β=0.1)优化β-VAE,以鼓励生成因素的解耦,同时避免潜在空间过度正则化。
- 引入两阶段训练流程:首先在解耦图像上预训练SRL模型,然后使用提取的表征微调演员-评论家策略。
- 对比基于SRL的强化学习与联合SRL-RL训练及端到端强化学习的性能,验证解耦预训练表征的优势。
实验结果
研究问题
- RQ1对原始输入图像进行解耦,是否能显著提升在稀疏奖励下,演员-评论家深度强化学习在视觉抓取任务中的样本效率与最终性能?
- RQ2解耦程度(L0至L3)如何影响不同SRL模型在使强化学习有效学习多样化未见物体抓取策略方面的性能?
- RQ3在复杂场景中机器人抓取任务中,结合解耦表征时,哪种SRL架构(如SAE、VAE、β-VAE、FM+AE)表现最佳?
- RQ4在强化学习训练前对SRL模型进行预训练,是否能带来优于SRL与RL联合训练的性能提升?
- RQ5当应用于复杂且杂乱的视觉输入时,性能对β-VAE中的超参数β是否敏感?
主要发现
- 使用解耦图像表征显著提升了演员-评论家强化学习在视觉抓取任务中的成功率,其中FM+AE在L3解耦下表现最佳,成功率达到71.9%。
- 原始输入图像(L0)和低层次解耦(L1)无法有效支持策略学习,表明仅当表征具有足够结构时,才能支持策略学习。
- β-VAE在β=0.1时表现最佳,而更高的β值(如β=2)会降低性能,表明在复杂输入上过度正则化会损害学习效果。
- SAE在L2解耦时达到性能峰值,可能因其独特的编码器结构能以不同于标准自编码器的方式捕捉空间特征。
- 即使在L3解耦下,SRL与RL的联合训练也完全失败,原因在于演员与评论家网络之间的相互依赖,凸显了解耦预训练的优势。
- D4PG算法在相同设置下优于DDPG,但两者在使用预训练表征时均显著受益,成功率接近表现最佳的方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。