[论文解读] MonoViT: Self-Supervised Monocular Depth Estimation with a Vision Transformer
MonoViT 提出了一种自监督单目深度估计框架,通过将卷积神经网络(CNNs)与视觉Transformer(ViTs)相结合,联合建模局部和全局图像上下文。通过利用Transformer的全局感受野和CNN的局部特征提取能力,MonoViT在KITTI数据集上实现了最先进性能,并在Make3D和DrivingStereo数据集上展现出更优的泛化能力。
Self-supervised monocular depth estimation is an attractive solution that does not require hard-to-source depth labels for training. Convolutional neural networks (CNNs) have recently achieved great success in this task. However, their limited receptive field constrains existing network architectures to reason only locally, dampening the effectiveness of the self-supervised paradigm. In the light of the recent successes achieved by Vision Transformers (ViTs), we propose MonoViT, a brand-new framework combining the global reasoning enabled by ViT models with the flexibility of self-supervised monocular depth estimation. By combining plain convolutions with Transformer blocks, our model can reason locally and globally, yielding depth prediction at a higher level of detail and accuracy, allowing MonoViT to achieve state-of-the-art performance on the established KITTI dataset. Moreover, MonoViT proves its superior generalization capacities on other datasets such as Make3D and DrivingStereo.
研究动机与目标
- 解决卷积神经网络(CNNs)在自监督单目深度估计中感受野有限的问题,该问题限制了其对长距离依赖关系的建模能力。
- 通过整合视觉Transformer(ViTs)克服现有基于CNN模型的局部推理瓶颈,实现全局上下文建模。
- 设计一种混合主干网络架构,结合CNN与Transformer的优势,以提升深度预测精度和细粒度细节恢复能力。
- 在包括KITTI、Make3D和DrivingStereo在内的多样化数据集上,证明所提模型具有优越的泛化性能。
- 仅使用单目视频数据,无需标注的深度标签,建立自监督单目深度估计的新SOTA(最先进)水平。
提出的方法
- 设计一种混合编码器架构MonoViT,将普通卷积层与视觉Transformer(ViTs)中的多头自注意力模块相结合,以联合捕捉局部和全局图像表征。
- 采用双路径特征提取机制:CNN路径用于学习局部细节,Transformer路径用于建模图像中长距离的空间依赖关系。
- 通过“联合CNN与Transformer层”将CNN路径和Transformer路径的输出进行融合,实现在多尺度上的特征融合。
- 利用单目视频序列中的图像重投影损失作为自监督信号,借助连续帧之间的几何约束来监督深度预测。
- 在解码器中应用多尺度监督和跳跃连接,以增强特征精炼能力,并提升细粒度层级的预测精度。
- 在ImageNet上预训练主干网络,并在自监督对比学习的单目视频数据上端到端微调完整模型。
实验结果
研究问题
- RQ1混合CNN-Transformer编码器架构是否能通过在自监督单目深度估计中同时建模局部与全局上下文,从而提升深度估计精度?
- RQ2将视觉Transformer整合到自监督深度估计网络的主干中,是否相比纯CNN模型能带来在多样化数据集上的更好泛化性能?
- RQ3Transformer的全局感受野在多大程度上缓解了CNN在捕捉长距离依赖关系和细粒度结构细节方面的局限性?
- RQ4CNN路径、Transformer路径以及注意力模块在最终模型性能中各自贡献如何?
- RQ5所提出的MonoViT模型在KITTI、Make3D和DrivingStereo等基准数据集上,相较于现有SOTA方法的性能提升程度如何?
主要发现
- MonoViT在KITTI基准上实现了新的SOTA性能,绝对相对误差(Abs Rel)为0.099,优于所有先前的基于CNN和基于Transformer的模型。
- 在Make3D数据集上,MonoViT的精度高于CADepth和DIFFNet,其Abs Rel(0.099)更低,且δ1、δ2和δ3指标更优。
- 消融实验表明,若移除CNN路径,性能显著下降(Abs Rel上升至0.114),证实其在保留细粒度细节方面具有关键作用。
- 消融分析显示,Transformer路径对性能贡献显著,当其被移除时,Abs Rel上升至0.127,表明全局上下文建模至关重要。
- 解码器中的注意力模块至关重要,其移除会使Abs Rel上升至0.101,δ1从0.900降至0.898,表明其在精炼深度预测中的关键作用。
- MonoViT在DrivingStereo数据集上的泛化能力优于现有SOTA模型,其Abs Rel(0.099)更低,δ1(0.900)更高,表明其对复杂真实场景具有更强的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。