Skip to main content
QUICK REVIEW

[论文解读] Real-Time Stereo Vision on FPGAs with SceneScan

Konstantin Schauwecker|arXiv (Cornell University)|Sep 21, 2018
Advanced Vision and Imaging参考文献 5被引用 7
一句话总结

本文提出 SceneScan 和 SceneScan Pro 两款基于 FPGA 的立体视觉系统,可在高达 100 fps 的帧率下实现 340 万像素分辨率和 8 W 功耗的实时性能。该系统采用定制化的半全局匹配(SGM)算法,并结合多阶段后处理流水线(包括代价立方体滤波、斑点滤波、孔洞插值和降噪处理),生成高精度、稠密的视差图,适用于移动机器人在户外和远距离深度感知中的应用。

ABSTRACT

We present a flexible FPGA stereo vision implementation that is capable of processing up to 100 frames per second or image resolutions up to 3.4 megapixels, while consuming only 8 W of power. The implementation uses a variation of the Semi-Global Matching (SGM) algorithm, which provides superior results compared to many simpler approaches. The stereo matching results are improved significantly through a post-processing chain that operates on the computed cost cube and the disparity map. With this implementation we have created two stand-alone hardware systems for stereo vision, called SceneScan and SceneScan Pro. Both systems have been developed to market maturity and are available from Nerian Vision GmbH.

研究动机与目标

  • 为移动机器人和户外机器人应用开发一种低功耗、高性能的立体视觉系统,实现实时深度估计。
  • 通过利用 FPGA 硬件加速,突破高精度立体匹配算法的计算瓶颈。
  • 在强环境光和远距离条件下实现鲁棒的深度感知,此时主动传感技术会失效。
  • 提供即插即用、能效比高的解决方案,在功耗效率方面超越基于 GPU 的系统,同时保持高帧率和高分辨率。
  • 通过商业化、基于 FPGA 的硬件平台,使先进立体视觉技术对研究人员和开发者更加易用。

提出的方法

  • 在现场可编程门阵列(FPGA)上实现定制化的半全局匹配(SGM)算法,以支持实时立体匹配。
  • 集成一个多阶段后处理流水线,对代价立方体和视差图进行处理,以提升精度并减少噪声。
  • 应用代价立方体滤波器,使用 3×3×3 核心的 3D 中值滤波器和基于阈值的噪声抑制机制,抑制错误的代价值。
  • 使用斑点滤波器通过识别并标记小于最小尺寸阈值的连通区域,去除小的孤立视差。
  • 仅对小孔洞(min{lh, lv} ≤ lmax)进行间隙插值,且当边缘视差的幅值相近时才执行,以填补缺失的视差数据。
  • 应用降噪滤波器,在保留不连续性和无效视差的同时平滑视差图,确保边缘感知的平滑处理。

实验结果

研究问题

  • RQ1基于 FPGA 的 SGM 实现能否在高帧率和高分辨率下保持低功耗,实现真正的实时立体视觉?
  • RQ2多阶段后处理流水线在提升原始 SGM 输出视差图质量方面的有效性如何?
  • RQ3在移动机器人应用中,基于 FPGA 的立体视觉在功耗效率方面相比基于 GPU 的系统能提升多少?
  • RQ4在强环境光条件下,立体视觉能否保持高精度和稠密的视差图?
  • RQ5在紧凑、低功耗的 FPGA 系统中,处理速度、分辨率和视差范围之间的可实现权衡是什么?

主要发现

  • SceneScan Pro 在 640×480 分辨率下最高可实现 100 fps,视差范围为 128 像素;在 1600×1200 分辨率下可实现 15 fps,视差范围为 256 像素。
  • 系统支持最高 1856×1856(340 万像素)的图像分辨率,适用于远距离应用的高精度深度感知。
  • 在 256 像素视差范围内,SceneScan Pro 每秒可执行 51 亿次视差评估,输出 2000 万个视差。
  • 在 128 像素视差范围内,处理性能提升至每秒 3000 万个视差,支持高速 3D 点云生成。
  • 后处理流水线有效去除了噪声和遮挡,即使在具有挑战性的户外场景中,也能生成平滑且异常值极少的视差图。
  • 系统在远距离和近距离物体上均能保持稠密的视差测量,展现出在远距离和强光条件下的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。