Skip to main content
QUICK REVIEW

[论文解读] Anytime Stereo Image Depth Estimation on Mobile Devices

Yan Wang, Zihang Lai|arXiv (Cornell University)|Oct 26, 2018
Advanced Vision and Imaging参考文献 54被引用 13
一句话总结

本文提出 AnyNet,一种可随时进行的立体深度估计模型,可在移动设备上实现推理速度与精度之间的动态权衡。通过分阶段优化视差图——从低分辨率预测开始,逐步校正残差——该方法在 NVIDIA Jetson TX2 上实现了 10–35 FPS 的推理速度,参数量比当前最先进模型少两个数量级,同时在 KITTI 基准测试中保持了具有竞争力的精度。

ABSTRACT

Many applications of stereo depth estimation in robotics require the generation of accurate disparity maps in real time under significant computational constraints. Current state-of-the-art algorithms force a choice between either generating accurate mappings at a slow pace, or quickly generating inaccurate ones, and additionally these methods typically require far too many parameters to be usable on power- or memory-constrained devices. Motivated by these shortcomings, we propose a novel approach for disparity prediction in the anytime setting. In contrast to prior work, our end-to-end learned approach can trade off computation and accuracy at inference time. Depth estimation is performed in stages, during which the model can be queried at any time to output its current best estimate. Our final model can process 1242$ imes $375 resolution images within a range of 10-35 FPS on an NVIDIA Jetson TX2 module with only marginal increases in error -- using two orders of magnitude fewer parameters than the most competitive baseline. The source code is available at https://github.com/mileyan/AnyNet .

研究动机与目标

  • 解决在功耗与内存受限的移动设备上实现实时、高精度立体深度估计的挑战。
  • 在推理过程中实现计算时间与预测精度之间的动态权衡。
  • 在不牺牲嵌入式平台性能的前提下,降低模型复杂度与参数量。
  • 支持需要自适应响应延迟的实时机器人应用,如障碍物避让与路径规划。
  • 设计一种框架,允许在任意时刻查询模型以获取当前最优的深度估计。

提出的方法

  • 模型分阶段处理立体图像,首先在全视差范围内计算低分辨率(1/16)的视差图。
  • 后续阶段对当前估计结果进行上采样,并使用卷积神经网络(CNN)预测残差误差,将计算限制在较小的视差范围内(全范围的 10–20%)。
  • 残差预测通过仅聚焦于局部误差校正,实现快速优化,避免在高分辨率下进行全成本体积计算。
  • 网络采用基于 U-Net 的特征提取器,以在低分辨率下捕捉上下文信息,从而提升成本体积的质量。
  • 采用基于距离的成本体积构建方法,高效计算匹配代价,同时在速度与精度之间取得平衡。
  • 整个网络通过所有阶段的联合损失进行端到端训练,实现渐进式优化。

实验结果

研究问题

  • RQ1深度学习模型能否在移动硬件上实时实现计算与精度之间的动态权衡,用于立体深度估计?
  • RQ2在逐步提高分辨率的过程中,通过残差误差预测如何提升效率而不损失精度?
  • RQ3架构选择(如特征提取与成本体积构建)对速度-精度权衡的影响如何?
  • RQ4轻量化模型是否能在标准基准测试中实现最先进性能,同时参数量减少数个数量级?
  • RQ5与非可随时推理基线相比,可随时推理能力在延迟与精度方面表现如何?

主要发现

  • AnyNet 在 NVIDIA Jetson TX2 上对 1242×375 的立体图像实现了 10–35 FPS 的推理速度,显著优于 PSMNet(在同一硬件上低于 0.3 FPS)。
  • 该模型的参数量仅比最具有竞争力的基线模型少两个数量级,因此适用于资源受限设备。
  • 在 KITTI-2015 上,AnyNet 在最终阶段达到 3 像素误差率为 6.2%,与当前最先进性能相当或更优。
  • 消融实验表明,若移除 U-Net 特征提取器,第一阶段的误差将增加 5.5 个百分点,凸显其对低分辨率特征质量的重要性。
  • 若将残差预测替换为直接视差预测,后期阶段的推理时间将增加六倍以上,证实了残差优化策略的高效性。
  • 基于距离的成本体积构建方法比 PSMNet 风格的方法快 10%,表明其在速度-精度权衡方面更具优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。