Skip to main content
QUICK REVIEW

[论文解读] An Integrated Simulator and Dataset that Combines Grasping and Vision for Deep Learning

Matthew Veres, Medhat Moussa|arXiv (Cornell University)|Feb 7, 2017
Robot Manipulation and Learning参考文献 16被引用 7
一句话总结

本论文提出了一款开源模拟器与数据集,结合视觉与机器人抓取技术以支持深度学习,利用V-REP平台生成了超过50,000次圆柱形物体的高精度抓取数据,包含RGB-D图像、三维抓取位姿及物体属性。该系统支持在多个计算节点上进行数据采集,通过集成的感官反馈与以物体为中心的抓取表征,支持多模态学习。

ABSTRACT

Deep learning is an established framework for learning hierarchical data representations. While compute power is in abundance, one of the main challenges in applying this framework to robotic grasping has been obtaining the amount of data needed to learn these representations, and structuring the data to the task at hand. Among contemporary approaches in the literature, we highlight key properties that have encouraged the use of deep learning techniques, and in this paper, detail our experience in developing a simulator for collecting cylindrical precision grasps of a multi-fingered dexterous robotic hand.

研究动机与目标

  • 为解决机器人抓取中的数据稀缺问题,通过仿真技术实现大规模、高效的数据采集。
  • 将视觉(RGB-D)与触觉反馈(抓取位姿)整合到统一的仿真框架中,以支持端到端学习。
  • 利用V-REP与分布式计算技术,构建可扩展、可并行化的仿真流水线,实现大规模数据生成。
  • 提供可复现的开源数据集,并附带结构化标注,用于训练机器人抓取的深度学习模型。
  • 通过结合感知数据(图像、深度)与物理抓取配置及物体动力学,支持多模态学习。

提出的方法

  • 模拟器使用V-REP配合Lua脚本,对Barrett机械手与64类物体进行建模,实现逼真的抓取模拟。
  • 通过应用于以物体为中心参考坐标系的旋转矩阵生成抓取候选,实现对抓取配置的系统性采样。
  • 模拟流水线包括三个阶段:预处理(物体设置与抓取候选生成)、执行(带传感器数据采集的抓取模拟)以及后处理(数据过滤与结构化)。
  • 感官数据包括RGB-D图像(4通道,640×480)、18维抓取位姿向量(手指位置与法向量)以及多个坐标系的12维齐次变换矩阵。
  • 物体属性如质心、惯性张量与质量在世界坐标系与工作空间坐标系中被记录,以增强物理真实性。
  • 数据以HDF5格式存储,图像、抓取位姿与物体属性分别存储为独立张量,便于深度学习任务中的高效加载。

实验结果

研究问题

  • RQ1如何设计一个可扩展的、集成的仿真环境,以结合视觉与机器人抓取技术用于深度学习?
  • RQ2在数据驱动学习中,最有效的抓取配置与感官数据表示方式是什么?
  • RQ3如何利用分布式计算高效地收集大规模、高质量的抓取数据?
  • RQ4以物体为中心的参考坐标系表示在实现系统性抓取候选生成中起到什么作用?
  • RQ5如何对多模态数据(RGB-D、抓取位姿、物理属性)进行结构化组织,以支持机器人操作中稳健的深度学习?

主要发现

  • 系统成功生成了50,557次抓取数据,其中训练集32,100次,验证集3,564次,测试集14,693次,覆盖64类物体。
  • 数据集包含高保真的RGB-D图像(640×480)、18维抓取位姿向量,以及多个坐标系的12维变换矩阵。
  • 物体属性如质心(1×3向量)、惯性张量(1×9向量)与质量(标量)均被准确捕捉并按物体存储。
  • 模拟器支持在多个计算节点上并行进行数据采集,实现高效扩展。
  • 数据集已通过GitHub与Zenodo开源,代码与数据可访问于 https://github.com/mveres01/grasping 与 http://dx.doi.org/10.5683/SP/KL5P5S。
  • 尽管经过后处理,由于仿真局限性,仍可能存在少量物理上不准确的抓取,表明数据集中存在轻微噪声。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。