Skip to main content
QUICK REVIEW

[论文解读] MIRA: Mental Imagery for Robotic Affordances

Yen-Chen Lin, Pete Florence|arXiv (Cornell University)|Dec 12, 2022
Robot Manipulation and Learning被引用 13
一句话总结

MIRA 提出了一种新颖的机器人推理框架,利用神经辐射场(NeRFs)实现基于心理意象的动作规划,仅通过 RGB 图像即可实现 6-DoF 机器人操作。通过循环合成正交新视角并基于功能预测优化动作,MIRA 仅用 10 次示范即实现了对未见过的俯仰外旋转的零样本泛化,在具有镜面、透明或细结构特征的物体上执行复杂现实任务时,性能优于依赖深度传感器的方法。

ABSTRACT

Humans form mental images of 3D scenes to support counterfactual imagination, planning, and motor control. Our abilities to predict the appearance and affordance of the scene from previously unobserved viewpoints aid us in performing manipulation tasks (e.g., 6-DoF kitting) with a level of ease that is currently out of reach for existing robot learning frameworks. In this work, we aim to build artificial systems that can analogously plan actions on top of imagined images. To this end, we introduce Mental Imagery for Robotic Affordances (MIRA), an action reasoning framework that optimizes actions with novel-view synthesis and affordance prediction in the loop. Given a set of 2D RGB images, MIRA builds a consistent 3D scene representation, through which we synthesize novel orthographic views amenable to pixel-wise affordances prediction for action optimization. We illustrate how this optimization process enables us to generalize to unseen out-of-plane rotations for 6-DoF robotic manipulation tasks given a limited number of demonstrations, paving the way toward machines that autonomously learn to understand the world around them for planning actions.

研究动机与目标

  • 在不使用深度传感器的情况下,使机器人能够执行复杂 6-DoF 操作任务,尤其针对具有镜面、透明或细结构表面的物体。
  • 赋予机器人类人心理意象能力,以实现空间推理、规划与动作优化。
  • 通过实现新视角合成与正交渲染,克服基于功能的策略学习中 2D 俯视图与透视投影的局限性。
  • 仅使用 10 张 RGB 示范,实现对未见过的俯仰外旋转的样本高效泛化。
  • 证明仅依赖 RGB 感知并结合基于 NeRF 的心理意象,可在真实世界操作任务中超越依赖深度传感器的方法。

提出的方法

  • MIRA 使用多视角 RGB 图像通过体素渲染与透视射线投射训练神经辐射场(NeRFs),构建 3D 场景表征。
  • NeRF 优化完成后,系统执行正交射线投射,合成距离无关的新视角,保持平移等变性。
  • 将正交视角输入像素级功能模型,预测抓取与放置操作的动作值,实现在多个想象视角下的动作优化。
  • 通过在合成视角中搜索,选择得分最高的像素,其深度与朝向定义了机器人的 6-DoF 运动基元。
  • 整个流程在闭环中集成新视角合成与功能预测,支持反事实推理并实现对未见过姿态的泛化。
  • 该方法使用 instant-NGP 实现高效推理,并采用 CUDA 优化的正交射线投射,避免机器人手臂及其他干扰物造成的遮挡。

实验结果

研究问题

  • RQ1机器人能否通过在心理意象框架中模拟新视角,在仅使用 RGB 图像的情况下实现 6-DoF 操作?
  • RQ2与基于透视的渲染相比,正交视角合成在机器人功能预测中的动作规划方面有何改进?
  • RQ3当仅使用 10 张 RGB 示范进行训练时,基于 NeRF 的系统在多大程度上能泛化至俯仰外旋转?
  • RQ4在具有镜面、透明或细结构特征的挑战性真实世界任务中,仅依赖 RGB 感知并结合心理意象能否超越依赖深度传感器的方法?
  • RQ5基于 NeRF 的新视角合成与功能预测的集成,如何提升机器人操作中的样本效率与泛化能力?

主要发现

  • MIRA 仅使用 10 次真实世界 RGB 示范,即在将金属球放入杯子的任务中实现了 80% 的成功率,泛化至未见过的杯子配置与朝向。
  • 该框架在缠绕棉线任务中达到 60% 的成功率,在堆叠金属立方体任务中达到 70% 的成功率,表明其对细长、柔韧及反光物体的鲁棒性,这些物体常使深度传感器失效。
  • 尽管未使用深度传感器,MIRA 在扩展的 Ravens 基准测试中 6-DoF 重排任务上仍优于最先进方法。
  • 正交射线投射消除了训练期间机器人手臂造成的遮挡,而透视射线投射则捕捉到了手臂,导致真实标签被污染。
  • 该系统成功泛化至未见过的俯仰外旋转,实现了需要 3D 重新定向的动作,超越了俯视或 2D 平面动作的限制。
  • 失败案例主要源于 NeRF 的深度不准确(例如在空槽中)或错误的抓取点预测,表明在 3D 重建与策略泛化方面仍存在局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。