Skip to main content
QUICK REVIEW

[论文解读] Active Perception and Representation for Robotic Manipulation

Youssef Zaky, Mandakini Paruthi|arXiv (Cornell University)|Mar 15, 2020
Robot Manipulation and Learning参考文献 42被引用 4
一句话总结

该论文提出了一种主动感知与表征(APR)框架,通过双策略方法在机器人操作中整合眼动与手部控制:一种凝视策略用于主动控制摄像头以选择最佳视角,另一种抓取策略用于6-DoF操作。通过结合对数极坐标图像编码、基于生成查询网络(GQN)的自监督表征学习,以及从稀疏奖励中联合训练策略,该模型在模拟任务中实现了8%更高的抓取成功率,且样本效率至少是被动固定摄像头基线方法的四倍。

ABSTRACT

The vast majority of visual animals actively control their eyes, heads, and/or bodies to direct their gaze toward different parts of their environment. In contrast, recent applications of reinforcement learning in robotic manipulation employ cameras as passive sensors. These are carefully placed to view a scene from a fixed pose. Active perception allows animals to gather the most relevant information about the world and focus their computational resources where needed. It also enables them to view objects from different distances and viewpoints, providing a rich visual experience from which to learn abstract representations of the environment. Inspired by the primate visual-motor system, we present a framework that leverages the benefits of active perception to accomplish manipulation tasks. Our agent uses viewpoint changes to localize objects, to learn state representations in a self-supervised manner, and to perform goal-directed actions. We apply our model to a simulated grasping task with a 6-DoF action space. Compared to its passive, fixed-camera counterpart, the active model achieves 8% better performance in targeted grasping. Compared to vanilla deep Q-learning algorithms, our model is at least four times more sample-efficient, highlighting the benefits of both active perception and representation learning.

研究动机与目标

  • 为解决深度强化学习在机器人操作中被动视觉效率低下的问题,通过受灵长类视觉系统启发的主动感知方法加以改进。
  • 通过多视角观测,实现从原始视觉输入中高效、自监督地学习场景表征。
  • 利用单一奖励信号联合训练凝视与抓取策略,提升样本效率与任务性能。
  • 将样本高效的6-DoF抓取能力拓展至4-DoF自上而下的控制之外,实现更真实的物体操作。
  • 证明主动视角控制与空间异质视觉采样可提升表征质量与下游策略学习效果。

提出的方法

  • 第二个6-DoF机械臂控制安装在腕部的摄像头,主动调整视角并聚焦于任务相关的物体。
  • 图像通过对数极坐标变换处理,以突出中心区域,模仿灵长类的中央凹视觉系统。
  • 多模态编码器结合来自两个视角的视觉与本体感觉输入,形成综合的场景表征。
  • 使用生成查询网络(GQN)从多视角观测中学习解耦的、低维的场景表征。
  • 联合策略网络使用共享奖励函数,同时学习凝视与抓取行为,实现从稀疏奖励中端到端训练。
  • 模型使用单一奖励信号训练两个策略,其中凝视策略引导抓取策略聚焦于相关物体。

实验结果

研究问题

  • RQ1主动视角控制是否能提升基于视觉的机器人操作中的样本效率与性能?
  • RQ2与被动观察相比,通过主动感知实现的自监督多视角表征学习在多大程度上提升了策略学习效果?
  • RQ3统一策略框架是否能通过单一奖励信号联合学习凝视与抓取行为?
  • RQ4通过对数极坐标变换实现的空间异质视觉采样在多大程度上提升了表征质量与任务性能?
  • RQ5在6-DoF抓取任务中,主动感知与固定摄像头基线相比表现如何?

主要发现

  • 该主动感知模型在测试物体上的抓取成功率达到了85%,且在70,000次以内的抓取尝试中即实现,比被动固定摄像头基线高出8%。
  • APR模型在样本效率方面相比原始深度Q-learning算法至少提升了四倍,凸显了主动感知与表征学习的优势。
  • 随着训练进行,表征质量持续提升,表现为GQN生成的中心物体图像逐渐更加清晰,与性能提升呈正相关。
  • 该模型成功学习了能够根据物体几何形状与场景上下文自适应调整夹爪方向的6-DoF抓取策略。
  • 凝视策略学会了将注意力引导至任务相关的物体,从而为抓取策略隐式定义目标。
  • 主动感知与自监督表征学习的结合是样本效率提升的主要驱动力,即使在被动模型也使用表征学习的情况下,该模型仍表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。