Skip to main content
QUICK REVIEW

[论文解读] FADNet++: Real-Time and Accurate Disparity Estimation with Configurable Networks

Qiang Wang, Shaohuai Shi|arXiv (Cornell University)|Oct 6, 2021
Advanced Vision and Imaging参考文献 48被引用 4
一句话总结

FADNet++ 是一种可配置的实时深度神经网络,用于视差估计,通过结合高效的 2D 卷积与逐点相关性层及残差学习,在多种硬件平台上实现了亚 100ms 推理速度的同时达到最先进(SOTA)的准确性。该方法使用户能够生成不同变体(FADNet-T 至 FADNet++),以在移动设备和服务器 GPU 上实现可调节的精度与速度。

ABSTRACT

Deep neural networks (DNNs) have achieved great success in the area of computer vision. The disparity estimation problem tends to be addressed by DNNs which achieve much better prediction accuracy than traditional hand-crafted feature-based methods. However, the existing DNNs hardly serve both efficient computation and rich expression capability, which makes them difficult for deployment in real-time and high-quality applications, especially on mobile devices. To this end, we propose an efficient, accurate, and configurable deep network for disparity estimation named FADNet++. Leveraging several liberal network design and training techniques, FADNet++ can boost its accuracy with a fast model inference speed for real-time applications. Besides, it enables users to easily configure different sizes of models for balancing accuracy and inference efficiency. We conduct extensive experiments to demonstrate the effectiveness of FADNet++ on both synthetic and realistic datasets among six GPU devices varying from server to mobile platforms. Experimental results show that FADNet++ and its variants achieve state-of-the-art prediction accuracy, and run at a significant order of magnitude faster speed than existing 3D models. With the constraint of running at above 15 frames per second (FPS) on a mobile GPU, FADNet++ achieves a new state-of-the-art result for the SceneFlow dataset.

研究动机与目标

  • 解决深度学习立体匹配在实时应用中推理速度与精度之间的权衡问题。
  • 克服现有基于 3D 卷积的模型(CVM-Conv3D)因速度过慢且内存占用过高而难以在移动端部署的局限性。
  • 设计一种灵活可配置的网络架构,使用户可根据不同硬件平台平衡模型大小、精度与推理速度。
  • 在合成数据集(SceneFlow)和真实世界数据集上均实现最先进性能,同时保持低延迟与低内存占用。
  • 通过避免内存密集型的 3D 卷积,利用优化的 2D 设计与可配置通道缩放,实现移动端的高效部署。

提出的方法

  • 提出一种新型基于 2D 卷积的网络架构(FADNet++),用逐点相关性层替代 3D 卷积,以降低计算成本。
  • 集成残差块与多尺度残差学习,增强特征表示与模型精度,同时不增加推理延迟。
  • 引入可配置的通道缩放比例,生成多种模型变体(FADNet-T、FADNet-S、FADNet-M、FADNet++),其参数量与推理速度各不相同。
  • 采用统一且可扩展的训练策略训练所有变体,提升各配置下的精度表现。
  • 利用高效的 2D 操作与优化的层实现(如 cuDNN),确保在服务器与移动 GPU 上的快速推理。
  • 通过逐点相关性实现类似代价体积的表示,捕捉图像间特征关系,同时避免 3D 卷积带来的计算负担。

实验结果

研究问题

  • RQ1基于 2D 卷积的网络是否能在服务器与移动 GPU 上同时实现最先进视差估计精度与实时推理速度?
  • RQ2所提出的可配置通道缩放策略在不同硬件平台上平衡模型精度与推理速度方面的有效性如何?
  • RQ3FADNet++ 框架是否在精度与速度上均优于现有基于 3D 卷积的模型(CVM-Conv3D),特别是在内存受限的移动设备上?
  • RQ4与 3D 卷积相比,使用逐点相关性层在多大程度上降低了计算成本,同时保持了特征学习能力?
  • RQ5该模型是否能在 Jetson AGX 等移动 GPU 上实现低于 100ms 的推理时间(即 >15 FPS),同时相比现有实时方法保持较低的端到端误差(EPE)?

主要发现

  • 在 SceneFlow 数据集上,FADNet++ 在 RTX 2070 上的运行时间为 0.053 秒,EPE 为 0.76,相比 3D 模型在速度上表现更优,同时保持了具有竞争力的精度。
  • 在移动 GPU(Jetson AGX)上,FADNet++ 以 15 FPS 运行,EPE 为 0.258,相比 AnyNet 实现了接近三倍的精度提升,同时推理速度相近。
  • FADNet-S 在 TX2 和 AGX GPU 上分别比 StereoNet 快 4 倍与 5.9 倍,同时达到相近的 EPE(1.19 vs. 1.2),展现出卓越的效率。
  • FADNet++ 在 V100 上仅消耗 2.3 GB GPU 内存,远低于 GANet 等 3D 模型(7.5 GB),使其可在 3D 模型因内存限制而失败的移动端平台部署。
  • 可配置框架使用户可选择从 FADNet-T 到 FADNet++ 的模型变体,其 EPE 在 0.76 至 1.83 之间,推理时间在不同 GPU 上保持在 0.013 秒至 0.053 秒之间。
  • 在 Jetson AGX 移动 GPU 上,FADNet-T 实现 15 FPS,EPE 为 0.043,创下在 15 FPS 约束下移动端实时视差估计的新 SOTA 记录。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。