Skip to main content
QUICK REVIEW

[论文解读] Reinforcement Learning of Active Vision for Manipulating Objects under Occlusions

Ricson Cheng, Arpit Agarwal|arXiv (Cornell University)|Nov 20, 2018
Reinforcement Learning in Robotics参考文献 31被引用 21
一句话总结

本文提出了一种强化学习框架,用于机器人智能体联合控制夹爪与摄像头运动,以在存在遮挡的杂乱环境中操作物体。通过引入以物体为中心的注意力机制和课程学习,该方法实现了能够保持目标物体可视性的主动视觉策略,在遮挡情况下的成功率显著优于静态摄像头基线。

ABSTRACT

We consider artificial agents that learn to jointly control their gripperand camera in order to reinforcement learn manipulation policies in the presenceof occlusions from distractor objects. Distractors often occlude the object of in-terest and cause it to disappear from the field of view. We propose hand/eye con-trollers that learn to move the camera to keep the object within the field of viewand visible, in coordination to manipulating it to achieve the desired goal, e.g.,pushing it to a target location. We incorporate structural biases of object-centricattention within our actor-critic architectures, which our experiments suggest tobe a key for good performance. Our results further highlight the importance ofcurriculum with regards to environment difficulty. The resulting active vision /manipulation policies outperform static camera setups for a variety of clutteredenvironments.

研究动机与目标

  • 解决在杂乱环境中因干扰物频繁遮挡目标物体而带来的机器人操作挑战。
  • 使智能体能够学习夹爪与摄像头的协同控制,以在操作过程中保持目标物体的可见性。
  • 研究模块化演员-critic架构结合目标检测器集成在主动感知与动作中的有效性。
  • 探索课程学习与辅助奖励在提升策略样本效率和遮挡环境下性能方面的作用。
  • 证明在遮挡环境中,主动摄像头控制相比静态摄像头设置能带来更高的操作成功率。

提出的方法

  • 设计一种模块化演员-critic架构,其中夹爪策略基于抽象状态表示运行,而摄像头策略则基于目标检测器输出进行条件控制。
  • 集成一个预训练的目标检测模块,实时估算目标物体的位置与可见性,为网络提供结构化的注意力偏置。
  • 采用状态抽象机制解耦感知与动作,使夹爪策略能够专注于任务相关状态信息。
  • 通过在无干扰物环境初始化策略,再在存在遮挡的杂乱场景中微调,实现课程学习。
  • 使用密集操作奖励训练摄像头策略,并评估添加辅助可见性奖励对目标检测的影响。
  • 应用事后经验回放(HER)以提升样本效率,但结果表明辅助可见性奖励并未提升性能。

实验结果

研究问题

  • RQ1联合学习手部与眼部控制是否能提升在存在物体遮挡环境中的操作成功率?
  • RQ2通过检测器模块引入以物体为中心的注意力机制,是否能显著提升策略性能,相比标准CNN?
  • RQ3从简单到复杂环境的课程学习在多大程度上提升了训练稳定性和成功率?
  • RQ4添加辅助可见性奖励是否能改善主动摄像头控制策略的学习效果?
  • RQ5在遮挡条件下,主动摄像头控制与静态摄像头设置相比,操作成功率如何?

主要发现

  • 所提出的主动视觉策略在存在干扰物的环境中实现了71.0% ± 2.2%的成功率,显著优于静态摄像头基线的55.8% ± 6.6%。
  • 基于原始CNN的演员-critic网络即使在简单干扰物存在下也未能学习到操作任务,凸显了结构化感知模块的必要性。
  • 将训练好的目标检测器集成到演员-critic架构中,使在遮挡条件下实现有效操作学习成为可能。
  • 课程学习——从无干扰物环境开始初始化——显著提升了最终性能,证明其在样本效率中的关键作用。
  • 添加辅助可见性奖励并未提升性能(68.4% ± 1.5%),甚至略微低于最佳设置(71.0% ± 2.2%),表明密集奖励可能干扰策略学习。
  • 对学习策略的可视化显示,智能体能主动移动摄像头以避免遮挡,例如在物体被推至圆柱体附近时持续追踪,或向上移动以越过障碍物观察。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。