[论文解读] BlendedMVS: A Large-scale Dataset for Generalized Multi-view Stereo Networks
本文介绍了BlendedMVS,一个用于训练泛化性多视角立体(MVS)网络的大规模合成数据集。通过从真实图像重建高质量纹理3D网格,并将其渲染到新视角,作者生成了训练数据,其中渲染的颜色图像与输入图像混合,以保留真实光照效果,同时确保与深度图的一致性。在BlendedMVS上训练的模型在现有数据集上的泛化性能显著提升。
While deep learning has recently achieved great success on multi-view stereo (MVS), limited training data makes the trained model hard to be generalized to unseen scenarios. Compared with other computer vision tasks, it is rather difficult to collect a large-scale MVS dataset as it requires expensive active scanners and labor-intensive process to obtain ground truth 3D structures. In this paper, we introduce BlendedMVS, a novel large-scale dataset, to provide sufficient training ground truth for learning-based MVS. To create the dataset, we apply a 3D reconstruction pipeline to recover high-quality textured meshes from images of well-selected scenes. Then, we render these mesh models to color images and depth maps. To introduce the ambient lighting information during training, the rendered color images are further blended with the input images to generate the training input. Our dataset contains over 17k high-resolution images covering a variety of scenes, including cities, architectures, sculptures and small objects. Extensive experiments demonstrate that BlendedMVS endows the trained model with significantly better generalization ability compared with other MVS datasets. The dataset and pretrained models are available at \url{https://github.com/YoYo000/BlendedMVS}.
研究动机与目标
- 解决基于学习的多视角立体(MVS)网络缺乏大规模、多样化且逼真的训练数据的问题。
- 通过将真实图像中的真实环境光照和视觉线索融入合成训练数据,提升模型泛化能力。
- 提供一种可扩展、低成本的流水线,用于生成高质量训练数据,无需依赖昂贵的主动扫描设备。
- 使模型在DTU等小型固定轨迹数据集之外的真实世界和多样化场景中表现更优。
- 通过提供包括深度图、遮挡图和法线图在内的丰富标注,支持未来在3D几何任务中的研究。
提出的方法
- 使用3D重建流水线从真实图像中重建高保真度纹理3D网格。
- 从多个视角渲染纹理网格,生成合成颜色图像及对应的深度图。
- 将渲染的颜色图像与原始输入图像混合,以保留真实世界的光照和纹理,同时保持与深度图的对齐。
- 将混合图像作为MVS网络的输入,确保外观与几何之间的一致性。
- 在训练过程中应用在线光度增强,进一步提升对视角相关光照效应的鲁棒性。
- 通过在混合前对输入图像中的动态元素(如行人)进行删除或模糊处理,确保数据隐私。
实验结果
研究问题
- RQ1结合真实图像与渲染图像的合成数据集是否能提升MVS网络在多样化真实场景中的泛化性能?
- RQ2将真实输入图像中的环境光照融入渲染训练数据,对模型性能有何影响?
- RQ3在像BlendedMVS这样大规模、多样化的数据集上进行训练,是否能提升在DTU和Tanks and Temples等基准数据集上的表现?
- RQ4光度增强在多大程度上提升了MVS网络对光照变化的鲁棒性?
- RQ5所提出的数据生成流水线能否适配MVS以外的其他3D几何任务?
主要发现
- 在BlendedMVS上训练的模型在DTU、Tanks and Temples和ETH3D基准测试中,泛化性能显著优于在其他数据集上训练的模型。
- 消融实验证明,结合在线光度增强的混合图像在DTU数据集上实现了最低的验证误差,优于仅使用输入图像或仅使用渲染图像的训练方式。
- 仅使用输入图像进行训练也取得了令人满意的结果,表明重建的3D模型足够准确,可作为训练的半真值。
- 使用混合图像能有效保护隐私,通过模糊或移除行人等动态元素。
- 该数据集包含113个多样化场景中的超过17,000张高分辨率图像,涵盖城市、建筑、雕塑和小型物体。
- 该数据集支持额外的标注,如遮挡图和法线图,可为未来的可见性感知型和基于图像块的MVS网络提供支持。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。