Skip to main content
QUICK REVIEW

[论文解读] Lite-Mono: A Lightweight CNN and Transformer Architecture for Self-Supervised Monocular Depth Estimation

Ning Zhang, Francesco Nex|arXiv (Cornell University)|Nov 23, 2022
Image Processing Techniques and Applications被引用 7
一句话总结

Lite-Mono 提出了一种轻量级混合 CNN-Transformer 架构,用于自监督单目深度估计,结合连续空洞卷积(CDC)进行多尺度局部特征提取,以及使用交叉协方差自注意力机制的局部-全局特征交互(LGFI)模块,以编码长距离上下文。该方法在 KITTI 数据集上实现了最先进(SOTA)的精度表现,参数量仅为 Monodepth2 的 20%,展现出在边缘设备上的卓越效率与性能。

ABSTRACT

Self-supervised monocular depth estimation that does not require ground truth for training has attracted attention in recent years. It is of high interest to design lightweight but effective models so that they can be deployed on edge devices. Many existing architectures benefit from using heavier backbones at the expense of model sizes. This paper achieves comparable results with a lightweight architecture. Specifically, the efficient combination of CNNs and Transformers is investigated, and a hybrid architecture called Lite-Mono is presented. A Consecutive Dilated Convolutions (CDC) module and a Local-Global Features Interaction (LGFI) module are proposed. The former is used to extract rich multi-scale local features, and the latter takes advantage of the self-attention mechanism to encode long-range global information into the features. Experiments demonstrate that Lite-Mono outperforms Monodepth2 by a large margin in accuracy, with about 80% fewer trainable parameters.

研究动机与目标

  • 设计一种轻量且高精度的模型,适用于边缘设备部署的自监督单目深度估计。
  • 解决 CNN 在捕捉长距离依赖关系方面的局限性,同时避免标准 Transformer 的高计算成本。
  • 在包含遮挡和运动物体等复杂场景下,提升深度估计精度,且无需真实深度监督。
  • 在模型大小、浮点运算量(FLOPs)和推理速度之间实现理想的权衡,以支持实时应用。

提出的方法

  • 引入连续空洞卷积(CDC)模块,通过按顺序应用递增的空洞率来提取多尺度局部特征,且不增加参数量。
  • 提出局部-全局特征交互(LGFI)模块,利用通道维上的交叉协方差自注意力机制,高效地将全局上下文注入局部特征。
  • 采用跨阶段跳跃连接,以增强编码器各阶段之间的特征传播与信息融合。
  • 使用池化拼接操作,在下采样过程中保留空间分辨率,以最小的参数开销最小化信息损失。
  • 采用混合编码器架构,每个阶段中先使用 CDC 块,再接 LGFI 模块,以平衡局部与全局特征学习。
  • 优化 CDC 块中的空洞率配置——浅层使用较小的空洞率,深层则逐层加倍,以平衡局部细节与多尺度感知能力。

实验结果

研究问题

  • RQ1轻量级 CNN-Transformer 混合架构是否能在显著减少参数量的前提下,实现自监督单目深度估计的最先进性能?
  • RQ2所提出的 CDC 模块在不增加模型复杂度的情况下,是否能有效提升多尺度局部特征提取能力?
  • RQ3LGFI 模块在将长距离全局上下文整合到局部特征中时,其性能提升程度如何?
  • RQ4CDC 模块中不同空洞率配置对模型感知小尺寸和中尺寸物体的能力有何影响?
  • RQ5在边缘平台中,模型效率、精度与推理速度之间的权衡关系如何?

主要发现

  • Lite-Mono 在 KITTI 数据集上的绝对相对误差(Abs Rel)为 0.107,尽管参数量仅为 Monodepth2 的 20%,仍实现了更低的误差。
  • 该模型将 RMSE 降低至 4.561,同时将 δ1 提升至 0.886,表明其在复杂深度估计任务中具有更优的精度表现。
  • 消融实验表明,若移除 LGFI 模块,精度将出现显著下降,证实其在捕捉长距离上下文中的关键作用。
  • 采用优化空洞率配置(1, 2, 3 后接 2, 4, 6)的 CDC 模块,优于使用极大空洞率的配置,后者会损害局部特征感知能力。
  • 在 Jetson Xavier 平台上的推理结果验证了 Lite-Mono 的高效性,展现出面向边缘部署的优异速度-精度权衡。
  • 在 Make3D 数据集上的泛化能力验证表明,该模型在 KITTI 基准之外也具备良好的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。