[论文解读] SceneNet RGB-D: 5M Photorealistic Images of Synthetic Indoor Trajectories with Ground Truth
SceneNet RGB-D 引入了一个大规模的合成数据集,包含从15,000条合成室内轨迹生成的500万张照片级真实感RGB-D图像,其像素级完美真实值涵盖语义分割、实例分割、光流、深度估计、相机位姿和3D重建。该数据集通过物理模拟的物体布局、随机光照、纹理化场景布局以及基于光线追踪渲染管线的运动模糊相机轨迹生成,支持对数据需求量大的视觉模型进行高保真预训练。
We introduce SceneNet RGB-D, expanding the previous work of SceneNet to enable large scale photorealistic rendering of indoor scene trajectories. It provides pixel-perfect ground truth for scene understanding problems such as semantic segmentation, instance segmentation, and object detection, and also for geometric computer vision problems such as optical flow, depth estimation, camera pose estimation, and 3D reconstruction. Random sampling permits virtually unlimited scene configurations, and here we provide a set of 5M rendered RGB-D images from over 15K trajectories in synthetic layouts with random but physically simulated object poses. Each layout also has random lighting, camera trajectories, and textures. The scale of this dataset is well suited for pre-training data-driven computer vision techniques from scratch with RGB-D inputs, which previously has been limited by relatively small labelled datasets in NYUv2 and SUN RGB-D. It also provides a basis for investigating 3D scene labelling tasks by providing perfect camera poses and depth data as proxy for a SLAM system. We host the dataset at http://robotvault.bitbucket.io/scenenet-rgbd.html
研究动机与目标
- 为训练数据需求量大的深度学习模型,解决大规模、高质量、完全监督的RGB-D数据集稀缺的问题。
- 通过生成具有完整真实值的逼真合成数据,减少对昂贵人工标注的依赖。
- 通过使用逼真、多样化且可扩展的合成数据,实现视觉模型的端到端预训练。
- 通过提供一致的相机轨迹和度量深度,支持时序与几何视觉任务。
- 通过物理上合理的随机室内场景配置,促进域自适应与3D场景理解。
提出的方法
- 使用具有完整光照效果、运动模糊和真实相机响应函数的光线追踪渲染器生成逼真RGB-D图像。
- 通过在Chrono引擎中使用物理模拟布局,随机将ShapeNet中的3D物体放置到合成场景中,确保稳定且逼真的配置。
- 自动生成相机轨迹以模拟自然的人类运动,路径平滑连续,并通过插值姿态实现运动模糊。
- 使用1至5个光源(点光源和面光源)应用随机光照,光源的色调、功率和位置随机,但偏向场景上半部分。
- 从大量真实世界材质(如墙壁、地板、窗帘)中随机采样纹理,确保场景间视觉多样性。
- 应用非线性相机响应函数(CRF)以模拟真实相机行为,运动模糊通过渲染期间对相机姿态进行时间积分实现。
实验结果
研究问题
- RQ1能否大规模生成一个完全合成的、逼真的RGB-D数据集,并提供完整的像素级真实值,以支持数据需求量大的视觉模型?
- RQ2在光流和深度估计等任务中,具有逼真光照、运动模糊和物理上合理物体布局的合成数据,在模型预训练中的有效性如何?
- RQ3通过随机场景和轨迹生成,在无需人工设计或标注的情况下,能在多大程度上产生多样化、逼真且可扩展的训练数据?
- RQ4此类数据集能否在真实世界机器人和增强现实应用中实现更好的泛化能力和域自适应?
- RQ5包含精确相机轨迹和深度数据如何提升3D场景标注和类似SLAM系统的训练效果?
主要发现
- 该数据集包含超过15,000条独特相机轨迹生成的500万张高质量RGB-D图像,场景布局多样且随机生成。
- 每张图像均配有像素级精确的语义分割、实例分割、光流、深度和相机位姿标注,支持多任务学习。
- 通过光线追踪和真实CRF的应用,确保图像具有逼真质量,高度模拟真实相机行为。
- 通过插值相机姿态的时间积分有效模拟了运动模糊,增强了真实感,且不影响真实值标签。
- 随机光照和纹理应用使得相同几何布局生成的渲染结果在视觉上各不相同,显著提升了数据多样性。
- 尽管存在静态场景和缺乏动态物理模拟的局限性,该数据集仍能实现稳健的预训练,并在机器人和AR领域的域自适应方面展现出强大潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。