Skip to main content
QUICK REVIEW

[论文解读] Inferring Occluded Geometry Improves Performance when Retrieving an Object from Dense Clutter

Andrew Price, Linyi Jin|arXiv (Cornell University)|Jul 20, 2019
Robotics and Sensor-Based Localization被引用 7
一句话总结

本文提出将基于深度学习的形状补全网络与体素记忆系统整合进操作规划框架,以在密集杂乱环境中推断被遮挡的物体几何形状。通过推理隐藏物体的形状以及先前观察到的自由空间,该系统减少了检索目标物体所需的动作数量,在高度遮挡的场景中实现了统计上显著的性能提升,且无需依赖CAD模型或标注数据。

ABSTRACT

Object search -- the problem of finding a target object in a cluttered scene -- is essential to solve for many robotics applications in warehouse and household environments. However, cluttered environments entail that objects often occlude one another, making it difficult to segment objects and infer their shapes and properties. Instead of relying on the availability of CAD or other explicit models of scene objects, we augment a manipulation planner for cluttered environments with a state-of-the-art deep neural network for shape completion as well as a volumetric memory system, allowing the robot to reason about what may be contained in occluded areas. We test the system in a variety of tabletop manipulation scenes composed of household items, highlighting its applicability to realistic domains. Our results suggest that incorporating both components into a manipulation planning framework significantly reduces the number of actions needed to find a hidden object in dense clutter.

研究动机与目标

  • 为解决在物体被遮挡、传统方法因视野不足而失效的密集杂乱环境中进行物体检索的挑战。
  • 克服现有物体搜索系统依赖CAD模型或标注图像的局限,这些方法在家庭等非结构化环境中不切实际。
  • 探究通过形状补全推断被遮挡几何形状,并保持对自由空间和被遮挡形状的记忆,是否能提升操作规划效率。
  • 开发并评估一种框架,通过推理隐藏物体几何形状和先前观测结果,提升在杂乱场景中的动作选择效率。

提出的方法

  • 系统使用深度神经网络进行形状补全,利用已知的自由空间体积来提升在部分观测场景中的重建精度。
  • 体素记忆系统用于存储并追踪先前观测到的物体形状和自由空间,使机器人能够随时间推理被遮挡区域。
  • 操作规划器基于RGBD图像的体素分割运行,使用运动基元选择并执行动作。
  • 通过形状补全推断部分可见物体的完整几何形状,从而减少动作选择中的不确定性。
  • 该框架将形状补全与记忆作为规划循环中的组件进行整合,使机器人能够基于推断出的被遮挡几何形状优先选择动作。
  • 系统在包含8个桌面场景、不同杂乱程度的182次实验中,于双臂机器人设置下进行评估。

实验结果

研究问题

  • RQ1在密集杂乱环境中,将形状补全整合进操作规划框架是否能减少检索目标物体所需的动作数?
  • RQ2一种能追踪先前观测到的自由空间和被遮挡物体几何形状的记忆系统,是否能提升物体搜索任务的性能?
  • RQ3在真实世界的杂乱环境中,将形状补全应用于被遮挡场景时,其性能与先前方法相比如何?
  • RQ4形状补全与记忆的结合是否在多样化的杂乱场景中带来动作效率的统计显著提升?

主要发现

  • 在密集杂乱场景(D1-D3)中,同时具备形状补全与记忆的完整框架将平均动作数从5.364降低至3.300,t统计量为2.6,p值为0.012,显示出强烈的统计显著性。
  • 在场景B中,目标被一个小型圆柱体遮挡,且被大型遮挡盒包围,增强系统在约一半的实验中首先选择了正确的物体(即圆柱体)进行移动,从而实现两步内最优检索。
  • 仅使用记忆系统即显著提升了性能,在场景A中将动作数从基线平均值4.000降低至2.455,t统计量为5.8,p值为0.00002。
  • 仅使用形状补全在场景B中也优于基线(平均动作数:3.300 vs. 5.400),尽管p值为0.056,属边缘显著,表明其具有中等但有意义的影响。
  • 完整框架在稀疏杂乱场景(C1和C3)中表现出显著改进,但在C2中出现轻微退化,表明性能增益具有情境依赖性,且在高遮挡场景中最为显著。
  • 完整框架的计算时间主要由动作选择(7.32秒)和执行(34.98秒)主导,形状补全仅增加1.67秒,表明关键组件的开销极低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。