[论文解读] Occlusions, Motion and Depth Boundaries with a Generic Network for Disparity, Optical Flow or Scene Flow Estimation
本文提出了一种通用的深度学习框架,通过基于FlowNet 2.0的单个网络架构,联合估计视差、光流、遮挡区域以及深度/运动边界。通过端到端训练并显式监督遮挡区域和边界,该方法在KITTI和Sintel基准测试中实现了最先进性能,遮挡估计精度显著提升,推理速度更快,同时通过更优的遮挡感知特征学习,进一步提升了运动分割和场景流结果。
Occlusions play an important role in disparity and optical flow estimation, since matching costs are not available in occluded areas and occlusions indicate depth or motion boundaries. Moreover, occlusions are relevant for motion segmentation and scene flow estimation. In this paper, we present an efficient learning-based approach to estimate occlusion areas jointly with disparities or optical flow. The estimated occlusions and motion boundaries clearly improve over the state-of-the-art. Moreover, we present networks with state-of-the-art performance on the popular KITTI benchmark and good generic performance. Making use of the estimated occlusions, we also show improved results on motion segmentation and scene flow estimation.
研究动机与目标
- 为解决传统后处理方法难以有效应对遮挡估计与光流/视差估计之间的相互依赖问题。
- 提升基于深度学习的对应关系估计中遮挡和运动边界检测的准确性。
- 开发一种通用网络架构,在无需任务特定微调的情况下,同时在视差、光流和场景流等多个任务上表现优异。
- 证明显式遮挡估计可增强下游任务(如运动分割和场景流估计)的性能。
- 在保持最先进基准性能的同时,实现高推理速度。
提出的方法
- 该方法在FlowNet 2.0基础上扩展为多阶段优化架构,通过一次前向传播同时输出视差、光流、遮挡区域和深度/运动边界。
- 引入专用的损失头用于遮挡预测,与主光流和视差头端到端联合训练,使用真实遮挡掩码监督。
- 网络采用带有互相关层和3D卷积的代价体积,以建模视差或光流空间中的匹配代价,随后通过残差优化模块进行细化。
- 遮挡掩码由网络直接预测,避免依赖后向光流一致性,后者在实际中已被证明不可靠。
- 该框架支持稀疏和密集视差估计,引入一种新颖的插值模块,利用预测的遮挡区域提升场景流估计性能。
- 模型在多个数据集上进行训练,并在KITTI上进行微调以获得最佳性能,同时在其他数据集上也展现出强大的零样本泛化能力。
实验结果
研究问题
- RQ1一个深度神经网络能否在准确度上超越后处理方法,实现对遮挡区域与运动/视差场的联合预测?
- RQ2显式遮挡估计如何提升运动分割和场景流估计等下游任务的性能?
- RQ3遮挡与光流/视差的端到端联合训练对基准性能和推理速度有何影响?
- RQ4通用网络架构是否能在无需领域特定微调的情况下,在多个任务(视差、光流、场景流)上实现最先进性能?
- RQ5在遮挡边界检测准确度和运行时效率方面,该方法与现有最先进方法相比表现如何?
主要发现
- 在KITTI 2015基准测试中,该方法在微调后于测试集上实现了最先进性能,平均端点误差(AEE)为1.19,优于先前方法。
- 在Sintel基准测试中,网络在干净序列上的AEE为2.08,在最终序列上为3.94,性能与FlowNet2相当,但速度显著更快。
- 在KITTI 2015的非遮挡区域中,错误超过3像素的异常值比例降低至3.45%,表明在可靠区域具有更高的准确性。
- 当使用预测的遮挡区域作为输入时,运动分割性能显著提升,表明遮挡感知特征可增强物体边界检测能力。
- 利用预测遮挡区域进行场景流估计时,在KITTI基准上F1-all得分为11.34%,每帧仅需0.25秒运行时间,大幅优于先前方法。
- 该网络在不同领域间泛化能力出色,未微调版本在Sintel和KITTI上均表现强劲,表明对分布偏移具有鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。