[论文解读] 3D Common Corruptions and Data Augmentation
本文提出了3D通用损坏(3DCC),一种基于几何感知的图像损坏集合,可模拟现实世界中的失真现象,如基于深度视差的运动模糊、基于景深的散焦模糊,以及基于3D场景结构的遮挡。当用作数据增强时,该方法能提升模型的鲁棒性,在3DCC和AE基准测试中,相比仅使用2D增强的方法,误差最高可降低20%。
We introduce a set of image transformations that can be used as corruptions to evaluate the robustness of models as well as data augmentation mechanisms for training neural networks. The primary distinction of the proposed transformations is that, unlike existing approaches such as Common Corruptions, the geometry of the scene is incorporated in the transformations -- thus leading to corruptions that are more likely to occur in the real world. We also introduce a set of semantic corruptions (e.g. natural object occlusions). We show these transformations are `efficient' (can be computed on-the-fly), `extendable' (can be applied on most image datasets), expose vulnerability of existing models, and can effectively make models more robust when employed as `3D data augmentation' mechanisms. The evaluations on several tasks and datasets suggest incorporating 3D information into benchmarking and training opens up a promising direction for robustness research.
研究动机与目标
- 开发一个反映3D场景中真实世界分布偏移的、逼真的、几何感知的图像损坏基准。
- 解决仅使用2D损坏(如通用损坏)的局限性,后者忽略场景深度,导致不切实际的失真。
- 设计高效、实时生成的3D数据增强技术,结合3D场景几何结构以提升模型鲁棒性。
- 证明3DCC能暴露现有模型的脆弱性,并在训练中使用时提升其鲁棒性。
- 提供一个可扩展、可扩展的框架,适用于标准视觉数据集,且无需依赖3D标注。
提出的方法
- 利用单目深度估计获得的3D场景几何结构生成损坏,实现如视差运动模糊和景深模糊等逼真效果。
- 应用与场景感知的变换,如基于深度的雾气、带阴影的光照,以及基于3D场景重建的视角相关遮挡。
- 引入20种不同的3D损坏,包括散焦模糊、运动模糊、光照变化和语义遮挡,所有损坏均实时计算。
- 采用可微渲染与3D感知变形技术,在保持与场景几何空间一致性的前提下应用损坏。
- 采用双阶段训练策略:在3DCC上评估模型鲁棒性,并通过3D增强进行训练,以学习对几何失真的不变性。
- 通过利用估计的深度图,支持扩展至标准数据集(如ImageNet、Taskonomy),实现广泛适用性,且无需3D标签。
实验结果
研究问题
- RQ13D感知损坏与传统2D损坏在逼真度和故障模式暴露方面有何不同?
- RQ2现有鲁棒性方法在3D通用损坏下相较于2D损坏,其失效程度如何?
- RQ33D感知数据增强是否能显著提升模型在真实世界分布偏移下的鲁棒性?
- RQ4基于3DCC的增强与仅使用2D增强相比,在干净数据和损坏数据上的性能提升如何?
- RQ53DCC能否作为评估几何上合理损坏下泛化能力的可靠基准?
主要发现
- 3DCC基准暴露出使用2D数据增强训练的模型存在显著的鲁棒性缺陷,在3DCC上的性能下降最高达20%,相比2DCC。
- 使用3D数据增强训练的模型(Ours)在2DCC上达到5.32 ℓ₁误差,在3DCC上达到5.42 ℓ₁误差,优于O+DPT+2DCC(5.78和5.94)以及O+DPT(6.43和6.13)。
- 在AE基准(合成真实世界损坏)上,所提模型达到4.94 ℓ₁误差,相比O+DPT+2DCC(6.50)提升23.9%。
- 在OASIS数据集上,所提模型达到23.89角度误差,相比次优基线(24.65)提升4.9%,证明其在真实世界野外数据上的鲁棒性。
- Ours+X-TC模型进一步将2DCC上的误差降低至5.29,3DCC上为5.35,表明结合3D增强与跨任务一致性可进一步提升泛化能力。
- 定性结果表明,使用3D增强训练的模型在各类真实世界场景(包括DSLR图像和YouTube视频)中,预测结果显著更鲁棒。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。