QUICK REVIEW
[论文解读] Dense Scene Flow from Stereo Disparity and Optical Flow
René Schuster, Oliver Wasenmüller|arXiv (Cornell University)|Aug 30, 2018
Advanced Vision and Imaging参考文献 15被引用 4
一句话总结
该论文通过结合立体匹配视差与光流,利用图像扭曲和边缘感知插值,提出了一种实时密集场景流估计方法。采用SceneFlowFields(SFF)进行插值,在KITTI基准上实现了最先进性能,D1误差为6.6%,优于以往的重组合方法,同时保持了36秒的快速推理速度。
ABSTRACT
Scene flow describes 3D motion in a 3D scene. It can either be modeled as a single task, or it can be reconstructed from the auxiliary tasks of stereo depth and optical flow estimation. While the second method can achieve real-time performance by using real-time auxiliary methods, it will typically produce non-dense results. In this representation of a basic combination approach for scene flow estimation, we will tackle the problem of non-density by interpolation.
研究动机与目标
- 解决传统立体匹配与光流结合方法产生的非密集场景流输出问题。
- 通过利用快速、准确的辅助方法(视差与光流)实现实时密集场景流估计。
- 通过在扭曲视差与光流上应用先进插值技术,提升密集场景流的重建质量。
- 证明将高质量辅助结果与复杂插值方法结合,可获得更优的场景流性能。
提出的方法
- 该方法利用光流向后将时间$t+1$的视差图扭曲至时间$t$,以估计中间视差$d_t^{t+1}$,形成稀疏场景流表示。
- 采用双线性插值对亚像素视差值进行扭曲,但该方法在遮挡区域或图像边界处会产生缺失值。
- 通过SceneFlowFields(SFF)实现边缘感知插值,从稀疏组合结果中重建出密集的三维几何与运动场。
- SFF算法执行两步插值:首先估计局部平面以恢复几何结构,然后估计局部仿射变换以恢复三维运动。
- 评估了多种插值策略,包括几何与运动的联合插值,以及视差与运动分量的独立插值。
- 该方法集成了SPS-stereo用于视差估计和FlowFields++用于光流估计,二者均以高精度与高速度著称。
实验结果
研究问题
- RQ1将立体视差与光流结合是否能实现具有竞争力精度与实时性能的密集场景流?
- RQ2与标准插值方法相比,边缘感知插值在从稀疏估计中重建密集场景流方面表现如何?
- RQ3联合插值几何与运动分量是否优于分别插值视差与运动分量?
- RQ4辅助任务(视差与光流)性能的提升在重组合框架中对最终场景流质量的改善程度如何?
- RQ5与端到端场景流网络相比,所提方法在精度与推理速度方面表现如何?
主要发现
- 所提方法在KITTI场景流基准上的D1误差达到6.6%,相比原始SGM+SF组合方法降低了2.1个百分点,表现更优。
- 尽管在单个子任务上的精度略低,但联合插值策略(同时插值几何与运动)产生了最佳的整体场景流估计结果。
- 该方法仅需36秒推理时间,显著快于大多数端到端方法,并在速度-精度权衡方面优于多个最先进方法。
- 使用先进的辅助网络(SPS-stereo与FlowFields++)相比早期方法(如SGM与FF+)显著提升了基线性能。
- 基于局部平面模型(disp-plane)的扭曲视差插值与基于仿射运动模型(disp-affine)的插值均表现优异,其中disp-plane的SF误差为21.2%,disp-affine为20.4%。
- 结果表明,高质量辅助结果与复杂插值方法的结合,可在精度与效率上媲美甚至超越专用的端到端场景流网络。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。