Skip to main content
QUICK REVIEW

[论文解读] CutDepth:Edge-aware Data Augmentation in Depth Estimation

Yasunori Ishii, Takayoshi Yamashita|arXiv (Cornell University)|Jul 16, 2021
Advanced Vision and Imaging参考文献 14被引用 18
一句话总结

CutDepth 提出了一种用于单目深度估计的边缘感知数据增强方法,该方法在训练过程中将裁剪后的深度图粘贴到RGB图像上,同时保持结构一致性并增强特征多样性。该方法通过正则化潜在空间,提升了深度估计的准确性——尤其在远距离上表现更优,其在客观和主观评估中均优于传统的CutMix和CutOut等增强方法。

ABSTRACT

It is difficult to collect data on a large scale in a monocular depth estimation because the task requires the simultaneous acquisition of RGB images and depths. Data augmentation is thus important to this task. However, there has been little research on data augmentation for tasks such as monocular depth estimation, where the transformation is performed pixel by pixel. In this paper, we propose a data augmentation method, called CutDepth. In CutDepth, part of the depth is pasted onto an input image during training. The method extends variations data without destroying edge features. Experiments objectively and subjectively show that the proposed method outperforms conventional methods of data augmentation. The estimation accuracy is improved with CutDepth even though there are few training data at long distances.

研究动机与目标

  • 为解决单目深度估计中真实世界数据有限的挑战,提出一种新颖的数据增强策略。
  • 通过最少的训练数据,提升深度估计性能,尤其针对远距离物体。
  • 在增强过程中保持边缘特征的结构一致性,避免过度几何失真。
  • 通过增强输入对齐RGB与深度表征,实现潜在空间的正则化。
  • 从多样性、亲和性与估计准确性三个方面评估该方法的有效性。

提出的方法

  • CutDepth通过将输入RGB图像的随机区域替换为对应的真实深度图裁剪区域来执行数据增强。
  • 替换区域由从均匀分布中抽取的随机参数 a, b, c, d 确定,其大小由超参数 p 控制。
  • 通过二值掩码 M 执行混合操作,公式为 x′_s = M * x_s + (1 - M) * x_t,确保RGB与深度特征的空间对齐。
  • 当输入与深度通道数不同时(C_s ≠ C_t),沿通道维进行拼接以保持兼容性。
  • 通过确保深度与RGB边缘之间的空间对应关系,保留边缘特征,最大限度减少低层特征的破坏。
  • 该方法通过标准深度估计指标和潜在空间距离度量(RMSE、MAE、余弦相似度)进行评估。

实验结果

研究问题

  • RQ1与传统数据增强方法相比,CutDepth如何提升深度估计的准确性?
  • RQ2CutDepth在增强过程中在多大程度上保留了边缘特征与结构一致性?
  • RQ3CutDepth如何影响潜在空间中数据分布的多样性与亲和性?
  • RQ4CutDepth能否有效正则化RGB与深度特征之间的潜在表征?
  • RQ5在低数据环境下,CutDepth是否仍能保持性能,尤其是在远距离深度估计方面?

主要发现

  • 在KITTI数据集上,CutDepth在所有指标上均优于基线模型、CutOut、RE和CutMix,其中Abs Rel(0.136)、log10(0.055)、RMSE(0.278)和d1(92.8%)表现最佳。
  • 当 p = 0.75 时,CutDepth保持了稳定性能,而CutOut和RE等传统方法随 p 增大显著退化。
  • 仅使用25%的训练数据时,CutDepth的d1得分为89.7%,超过基线模型(87.2%)和CutMix(88.9%)。
  • 在潜在空间中,RGB与深度特征之间的余弦距离在CutDepth中最高(p=0.25时为0.37),表明其具有更强的特征对齐与正则化能力。
  • CutDepth在数据分布的多样性与亲和性方面表现更优,其分布更广且与原始数据的偏差更小,优于基线模型与传统方法。
  • 主观评估证实,CutDepth生成的物体轮廓更清晰,远距离深度估计效果优于基线模型与CutMix。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。