[论文解读] Google Scanned Objects: A High-Quality Dataset of 3D Scanned Household Items
本文介绍了 Google Scanned Objects(GSO),这是一个包含超过1,000件3D扫描家居物品的高质量、开源数据集,通过自定义的双目视觉与结构光扫描流程捕获。该数据集已预处理,适用于Ignition Gazebo和Bullet等仿真平台,支持机器人学与计算机视觉研究中的真实物理与视觉仿真,已在视觉、导航与操作等10个研究项目中展现显著影响。
Interactive 3D simulations have enabled breakthroughs in robotics and computer vision, but simulating the broad diversity of environments needed for deep learning requires large corpora of photo-realistic 3D object models. To address this need, we present Google Scanned Objects, an open-source collection of over one thousand 3D-scanned household items released under a Creative Commons license; these models are preprocessed for use in Ignition Gazebo and the Bullet simulation platforms, but are easily adaptable to other simulators. We describe our object scanning and curation pipeline, then provide statistics about the contents of the dataset and its usage. We hope that the diversity, quality, and flexibility of Google Scanned Objects will lead to advances in interactive simulation, synthetic perception, and robotic learning.
研究动机与目标
- 为解决当前交互式机器人仿真中用于训练深度学习系统的多样化、高保真3D物体模型匮乏的问题。
- 提供一个可扩展、经筛选的现实世界家居物品数据集,具备精确的几何形状与逼真的纹理。
- 通过提供物理上合理且视觉上逼真的3D模型,支持从仿真到现实的迁移学习。
- 通过标准化、可访问的数据集,支持机器人操作、导航与合成感知方面的研究。
- 建立一个可重复使用的高质量3D扫描与数据整理流程,用于仿真用途的日常物品。
提出的方法
- 采用自定义扫描装置,配备双台机器视觉相机、一台DSLR相机用于HDR色彩捕获,以及一个投影仪用于结构光图案投射,以捕获高分辨率3D网格。
- 基于标定的流程对亚像素级相机坐标进行对齐,并将双目图像对合并为连贯的原始网格重建结果。
- 实施质量保证与数据整理流程,对扫描结果进行筛选与优化,确保模型为封闭且高保真的形态。
- 将所有模型预处理为SDF格式,以实现与Ignition Gazebo和Bullet仿真平台的原生兼容性。
- 应用漫反射纹理映射,在保持跨仿真器兼容性的同时保留视觉保真度。
- 将数据集托管于Ignition Fuel,以支持可发现性、版本控制,并便于集成至研究工作流中。

实验结果
研究问题
- RQ1是否可通过可扩展的高质量3D扫描流程,生成大量适用于机器人仿真的逼真家居物品?
- RQ2高保真3D扫描在多大程度上提升了机器人学习任务中仿真环境的真实感与性能?
- RQ3与合成或手工建模的物体相比,GSO数据集在视觉与操作任务中实现从仿真到现实迁移的有效性如何?
- RQ4多样化的现实世界物体几何形状与纹理对深度学习模型在仿真中泛化能力的影响是什么?
- RQ5经过筛选的开源扫描物体数据集是否能加速合成感知、导航与机器人操作方面的研究?
主要发现
- GSO数据集包含1,030个高质量3D扫描的家居物品,每件物品均具备精确的几何形状与逼真的纹理,适用于物理仿真。
- 扫描流程实现了高几何保真度,表面平滑且轮廓边缘准确,优于典型的RGB-D扫描结果。
- 该数据集已集成至计算机视觉、机器人学与图形学领域的10个不同研究项目中,包括iGibson、NViSII与IBRNet。
- 使用GSO的研究项目报告称,在视觉真实感与从仿真到现实的迁移性能方面均有提升,尤其在抓取与导航任务中表现显著。
- 由于其高质量的真实世界几何结构,该数据集使不同可微分立体视觉与关键点形变模型的验证成为可能。
- 通过清理高光与透明材质的内部扩展,显著提升了生成模型(如RetinaGAN与RL-CycleGAN)的性能。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。