Skip to main content
QUICK REVIEW

[论文解读] LabelFusion: A Pipeline for Generating Ground Truth Labels for Real RGBD Data of Cluttered Scenes

Pat Marion, Pete Florence|arXiv (Cornell University)|Jul 15, 2017
Advanced Neural Network Applications参考文献 18被引用 8
一句话总结

LabelFusion 是一个开源流程,通过利用三维重建和ICP辅助的网格拟合,实现了对杂乱场景中真实RGBD数据的快速、高质量标注,将每幅场景的人工标注时间从数小时减少到数分钟。该方法在数天内生成了超过一百万个标注的物体实例,实证结果表明,多物体、多环境的训练数据能显著提升基于深度学习的分割模型在机器人操作任务中的泛化能力。

ABSTRACT

Deep neural network (DNN) architectures have been shown to outperform traditional pipelines for object segmentation and pose estimation using RGBD data, but the performance of these DNN pipelines is directly tied to how representative the training data is of the true data. Hence a key requirement for employing these methods in practice is to have a large set of labeled data for your specific robotic manipulation task, a requirement that is not generally satisfied by existing datasets. In this paper we develop a pipeline to rapidly generate high quality RGBD data with pixelwise labels and object poses. We use an RGBD camera to collect video of a scene from multiple viewpoints and leverage existing reconstruction techniques to produce a 3D dense reconstruction. We label the 3D reconstruction using a human assisted ICP-fitting of object meshes. By reprojecting the results of labeling the 3D scene we can produce labels for each RGBD image of the scene. This pipeline enabled us to collect over 1,000,000 labeled object instances in just a few days. We use this dataset to answer questions related to how much training data is required, and of what quality the data must be, to achieve high performance from a DNN architecture.

研究动机与目标

  • 解决机器人操作任务中缺乏大规模、真实世界、像素级标注的RGBD数据集(包含6DOF物体位姿)的问题。
  • 通过可复用的场景级标注流程,将RGBD数据的人工标注时间减少数个数量级。
  • 实证研究数据量、场景复杂度以及环境差异对机器人感知中深度学习泛化能力的影响。
  • 为研究人员提供一个可扩展的开源解决方案,以生成针对其特定机器人任务的定制化、高质量训练数据集。

提出的方法

  • 使用RGBD传感器从多个视角捕获场景的多视角RGBD视频。
  • 利用现有的多视角立体视觉和基于ICP的融合技术,构建场景的密集三维重建。
  • 通过ICP算法并辅以人工干预,将预存在的三维物体网格手动拟合到三维重建结果中,以实现精确的位姿估计。
  • 将标注后的三维网格重新投影到每张独立的RGBD图像上,生成像素级语义分割标签和6DOF物体位姿标签。
  • 优化数据采集过程,以提升视角多样性和场景差异性,从而改善神经网络的泛化性能。
  • 利用生成的数据集,在受控的数据变化条件下训练并评估当前最先进的语义分割网络。

实验结果

研究问题

  • RQ1在包含遮挡的多物体场景中进行训练,如何影响基于深度学习的语义分割网络的泛化性能?
  • RQ2训练数据中背景环境的多样性对模型泛化到新型、未见场景的能力有何影响?
  • RQ3每幅场景需要多少张视图才能达到最优的分割性能?高帧率(30 Hz)数据是否会产生边际收益递减?
  • RQ4当在新型、未见环境中测试时,基于单物体与多物体场景训练的网络性能相比如何?

主要发现

  • 即使在单物体配置下进行测试,基于包含遮挡的多物体场景训练的网络,其在新场景中的泛化能力也显著优于仅在单物体场景中训练的网络。
  • 在新型背景环境中的性能随训练背景数量的增加呈对数增长,约50个不同背景即可在未见场景中实现超过50%的IoU。
  • 分割性能随有效传感器采样率的提高而单调递增,但当采样率超过0.3 Hz后,性能增益开始减弱,表明对大多数应用而言3 Hz已足够。
  • 与较慢的机械臂安装数据相比,手持式数据采集设置(相机运动速度约0.05–0.17 m/s)在更高帧率下表现出更大的性能增益。
  • 该流程将每幅场景的人工标注时间从数小时缩短至仅数分钟,使研究团队在数天内即可收集超过一百万个标注的物体实例。
  • 最终生成的数据集包含352,000张标注图像和超过100万个物体实例,是目前公开可用的、同时具备像素级标签和6DOF物体位姿标注的最大RGBD数据集。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。