[论文解读] Dataset of Industrial Metal Objects
本文介绍了DIMO(工业金属物体数据集),该数据集包含超过31,000张真实世界图像以及553,800张合成多视角RGB图像,涵盖对称、无纹理、高度反光的工业金属物体,并附有精确的6D位姿标注。该数据集通过真实机器人多视角采集与受控光照、材质和场景构图变化的物理基础渲染生成,支持工业机器人领域中6D物体位姿估计的稳健仿真到现实的迁移。
We present a diverse dataset of industrial metal objects. These objects are symmetric, textureless and highly reflective, leading to challenging conditions not captured in existing datasets. Our dataset contains both real-world and synthetic multi-view RGB images with 6D object pose labels. Real-world data is obtained by recording multi-view images of scenes with varying object shapes, materials, carriers, compositions and lighting conditions. This results in over 30,000 images, accurately labelled using a new public tool. Synthetic data is obtained by carefully simulating real-world conditions and varying them in a controlled and realistic way. This leads to over 500,000 synthetic images. The close correspondence between synthetic and real-world data, and controlled variations, will facilitate sim-to-real research. Our dataset's size and challenging nature will facilitate research on various computer vision tasks involving reflective materials. The dataset and accompanying resources are made available on the project website at https://pderoovere.github.io/dimo.
研究动机与目标
- 解决在对称、无纹理、高度反光的工业金属物体上进行6D位姿估计时,缺乏多样化、真实感强的数据集的问题。
- 通过确保合成数据与真实世界数据之间高度一致,弥合仿真到现实迁移中的现实差距。
- 提供大规模、精确标注的数据集,支持机器人操作中反光物体感知的研究。
- 在合成数据中可控地改变环境因素(光照、构图、材质),以提升模型泛化能力。
提出的方法
- 使用安装在高精度工业机器人(Fanuc M20ia,重复定位精度0.1mm)上的多个标定相机(RGB、灰度、LiDAR)采集真实世界数据。
- 每个场景中从13个不同相机视角采集多视角图像,场景构图在物体形状、材质、承载物和光照条件下发生变化。
- 开发了一款新的开源标注工具,利用ChArUco标定和手眼标定技术,在真实世界图像中精确标注6D物体位姿。
- 使用模拟真实世界条件的物理基础渲染管道生成合成数据,包括真实反射效果和程序化表面缺陷(如划痕)。
- 对光照(光照贴图)、承载物、物体构图(异质/同质)和相机视角施加受控变化,每张真实场景生成71张合成视角图像。
- 数据集采用扩展的BOP格式,存储物体CAD模型(PLY格式)、相机内参/外参、6D位姿(相对于相机和全局世界坐标系)以及数据生成条件的元数据。
实验结果
研究问题
- RQ1大规模、多样化的反光工业金属物体数据集能否提升6D物体位姿估计模型在真实机器人应用中的泛化能力?
- RQ2通过真实材质与光照模拟的受控合成数据生成,在多大程度上能减少仿真到现实迁移中的现实差距?
- RQ3场景构图、光照和相机视角的变化如何影响无纹理反光物体的视觉外观及其位姿估计性能?
- RQ4能否通过整合真实与合成数据、保持一致标注与元数据的统一数据集,支持跨多个计算机视觉任务的稳健训练与评估?
主要发现
- 数据集包含超过31,200张真实世界图像,从每个场景的13个视角采集,使用多种相机类型(RGB、灰度、LiDAR)。
- 超过553,800张合成图像通过受控的光照、物体构图和相机视角变化生成,确保与真实世界数据高度对齐。
- 数据集包含相对于相机和全局世界坐标系的6D物体位姿标注,支持跨多个视角的一致性评估。
- scene_info.json中的元数据支持基于光照、承载物、构图类型和视角的子集选择,支持细粒度分析。
- 数据集已公开发布,配有专用项目网站、数据加载工具以及一款新的开源标注工具,以支持可复现性与社区使用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。