[论文解读] Depth Estimation with Simplified Transformer
本文提出了一种轻量级、硬件友好的视觉Transformer——简化Transformer单目深度估计(DEST),用于自监督单目深度估计。通过采用战略性架构简化和深度与位姿网络之间的联合注意力机制,DEST相比SOTA模型将模型大小减少了85%,推理延迟降低了86%,同时在KITTI数据集上实现了更优的精度,并在语义分割任务上展现出良好的泛化能力,且速度与性能均得到提升。
Transformer and its variants have shown state-of-the-art results in many vision tasks recently, ranging from image classification to dense prediction. Despite of their success, limited work has been reported on improving the model efficiency for deployment in latency-critical applications, such as autonomous driving and robotic navigation. In this paper, we aim at improving upon the existing transformers in vision, and propose a method for self-supervised monocular Depth Estimation with Simplified Transformer (DEST), which is efficient and particularly suitable for deployment on GPU-based platforms. Through strategic design choices, our model leads to significant reduction in model size, complexity, as well as inference latency, while achieving superior accuracy as compared to state-of-the-art. We also show that our design generalize well to other dense prediction task without bells and whistles.
研究动机与目标
- 解决现有视觉Transformer在实时应用中单目深度估计的高计算成本和高延迟问题。
- 设计一种简化Transformer架构,使其在GPU平台上既硬件友好又高效。
- 在不依赖大规模真实深度监督的情况下,提升自监督深度估计的精度。
- 使所提出的架构能够泛化到其他密集预测任务(如语义分割)。
- 在参数量和推理延迟极低的前提下,实现最先进的深度估计性能。
提出的方法
- 模型采用仅包含基础操作(自注意力、前馈网络)的简化Transformer编码器,以降低计算复杂度。
- 引入联合注意力机制,利用深度网络的特征为位姿网络计算注意力,从而增强特征学习。
- 框架采用双流训练设置:通过单目视频序列的光度重建损失,联合训练深度-网络(Depth-Net)和位姿-网络(Pose-Net)。
- 设计了模型变体(B0至B5),通过逐步增加深度和宽度,采用特定的块配置(如B0为(2,2,2,2))和特征图通道数。
- 推理阶段仅使用Depth-Net,训练后丢弃Pose-Net,从而实现高效部署。
- 在有无ImageNet或CityScapes预训练的情况下评估架构,并使用TensorRT进行推理速度优化。
实验结果
研究问题
- RQ1简化Transformer架构是否能在显著减小模型尺寸和推理延迟的同时,实现最先进的深度估计精度?
- RQ2深度与位姿网络之间的联合注意力机制在多大程度上改善了特征表示和预测精度?
- RQ3所提出的架构在多大程度上可泛化到其他密集预测任务(如语义分割)?
- RQ4硬件感知设计选择在不损失精度的前提下,对GPU平台上的延迟降低有多有效?
- RQ5在不同深度估计基准上,模型效率(参数量、MACs)与性能之间的权衡如何?
主要发现
- 与PackNet-SfM相比,DEST-B3将模型参数量减少85%,GMACs减少90%,同时在KITTI的大多数指标上表现更优。
- 最小的模型DEST-B0尽管尺寸极小,仍实现了具有竞争力的深度估计精度,展现出强大的泛化能力。
- 在V100 GPU上,使用FP16精度和TensorRT推理时,延迟降至8.87ms,相比PackNet-SfM在PyTorch中的64.76ms降低了86%。
- DEST-B3在CityScapes语义分割任务上达到72.58%的mIoU,参数量为18.08M,GMACs为142.78,精度优于SegFormer-B3,且延迟降低59%。
- 联合注意力机制显著提升了深度估计精度,与无此组件的基线模型SegFormer-B3相比表现更优。
- 该模型在语义分割任务上泛化效果良好,相比SegFormer-B3在参数量显著减少、延迟更低的前提下实现了更高的mIoU。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。