[论文解读] Improving Deep Stereo Network Generalization with Geometric Priors
本文提出在训练过程中将几何先验——梯度域平滑性与遮挡推理——整合进端到端深度立体网络,以在不增加推理成本的前提下提升其在真实世界数据上的泛化能力。通过在 FlyingThings3D 等合成数据集上进行训练,该方法将 PSM-Net 在 Middlebury 基准测试中的 MAE 从 5.37 降低至 3.21,显著增强了对无纹理和遮挡区域的鲁棒性,同时保持了原有推理速度。
End-to-end deep learning methods have advanced stereo vision in recent years and obtained excellent results when the training and test data are similar. However, large datasets of diverse real-world scenes with dense ground truth are difficult to obtain and currently not publicly available to the research community. As a result, many algorithms rely on small real-world datasets of similar scenes or synthetic datasets, but end-to-end algorithms trained on such datasets often generalize poorly to different images that arise in real-world applications. As a step towards addressing this problem, we propose to incorporate prior knowledge of scene geometry into an end-to-end stereo network to help networks generalize better. For a given network, we explicitly add a gradient-domain smoothness prior and occlusion reasoning into the network training, while the architecture remains unchanged during inference. Experimentally, we show consistent improvements if we train on synthetic datasets and test on the Middlebury (real images) dataset. Noticeably, we improve PSM-Net accuracy on Middlebury from 5.37 MAE to 3.21 MAE without sacrificing speed.
研究动机与目标
- 解决在合成数据或有限真实数据集上训练的深度立体网络在多样化真实场景测试时泛化能力差的问题。
- 提升在标准网络失效的无纹理和遮挡区域的鲁棒性。
- 在不增加推理时间或模型复杂度的前提下增强泛化能力。
- 开发可微分、可反向传播的模块,将几何先验注入端到端立体网络。
- 在 Middlebury 等真实世界基准上,对 PSM-Net 和 HSM-Net 等强基线方法进行验证。
提出的方法
- 引入梯度域平滑性先验,通过利用真实场景由连续表面构成的事实,鼓励预测的视差图呈现分段平滑特性。
- 增加遮挡推理模块,利用校正后的立体几何关系建模视差与遮挡之间的几何关系。
- 两个模块均可微分,仅在训练阶段集成,推理时对原始网络架构无任何修改。
- 模块作为损失组件在训练期间应用,实现端到端优化,无需修改网络结构。
- 该方法在 PSM-Net 和 HSM-Net 上进行评估,使用 FlyingThings3D 和 Falling Things 等合成数据集进行微调。
- 该方法与任何立体网络兼容,因其作为训练时正则化器运行。
实验结果
研究问题
- RQ1在合成数据上训练并测试于真实世界数据时,几何先验是否能提升深度立体网络的泛化能力?
- RQ2引入梯度域平滑性是否能提升在无纹理和低纹理区域的性能?
- RQ3显式遮挡推理是否能增强遮挡区域的视差估计?
- RQ4所提方法是否能在不降低推理速度或增加模型参数的情况下提升性能?
- RQ5合成训练数据的选择(如 FlyingThings3D 与 Falling Things)如何影响泛化性能?
主要发现
- 在同时使用两种几何先验微调后,PSM-Net 在 Middlebury 基准测试中的 MAE 从 5.37 降低至 3.21,相对提升达 40%。
- 仅使用 GradSmooth 模块时,PSM-Net 的 MAE 从 5.37 降低至 4.62,表明在所有数据集上均有稳定提升。
- 遮挡模块进一步提升了 PSM-Net 的性能,将 MAE 降低至 3.21,但在 HSM-Net 上影响较小,可能因其自身具备数据增强策略。
- 使用 Falling Things 数据集而非 FlyingThings3D 进行训练,使 PSM-Net 在 Middlebury 上的 MAE 从 5.37 降低至 1.41,表明数据集质量显著影响泛化能力。
- 在 Falling Things 上训练时,GradSmooth 模块将坏像素比例(bad-2.0)从 11.48% 降低至 10.35%,证实了鲁棒性的提升。
- 所提方法保持了推理速度,未增加模型参数,因为推理时仅使用原始网络。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。