Skip to main content
QUICK REVIEW

[论文解读] Domain-invariant Stereo Matching Networks

Feihu Zhang, Xiaojuan Qi|arXiv (Cornell University)|Nov 29, 2019
Advanced Vision and Imaging参考文献 53被引用 6
一句话总结

本文提出领域不变立体匹配网络(DSMNet),通过新颖的领域归一化层正则化跨域的特征分布,并采用可学习的非局部图基滤波器提取鲁棒的结构特征。DSMNet仅在合成数据上进行训练,即实现了跨域泛化的最先进性能,在KITTI 2015等真实世界基准上甚至优于微调后的模型。

ABSTRACT

State-of-the-art stereo matching networks have difficulties in generalizing to new unseen environments due to significant domain differences, such as color, illumination, contrast, and texture. In this paper, we aim at designing a domain-invariant stereo matching network (DSMNet) that generalizes well to unseen scenes. To achieve this goal, we propose i) a novel "domain normalization" approach that regularizes the distribution of learned representations to allow them to be invariant to domain differences, and ii) a trainable non-local graph-based filter for extracting robust structural and geometric representations that can further enhance domain-invariant generalizations. When trained on synthetic data and generalized to real test sets, our model performs significantly better than all state-of-the-art models. It even outperforms some deep learning models (e.g. MC-CNN) fine-tuned with test-domain data.

研究动机与目标

  • 解决立体匹配网络在应用于未见真实场景时因颜色、光照、对比度和纹理等域偏移导致的泛化能力差的问题。
  • 开发一种深度学习模型,可在无需在目标域数据上微调或适应的情况下,有效泛化至新的、未见的环境。
  • 减少由域偏移引起的特征中伪影和噪声,特别是在无纹理或反光区域及物体边界处。
  • 通过捕捉对域变化具有不变性的非局部结构与几何表征,提升立体匹配的鲁棒性。
  • 仅使用合成训练数据即在真实世界数据集上实现优越性能,消除对昂贵的真实域数据用于适应的依赖。

提出的方法

  • 引入一种领域归一化层,通过在空间和通道维度上正则化特征分布,以减轻域偏移的影响。
  • 设计一种可学习的非局部图基滤波层,以捕捉特征中的长程结构与几何关系,提升不变性。
  • 将整个网络构建成一个端到端可训练的模型,仅在合成数据集(如SceneFlow和Carla)上进行训练。
  • 利用非局部滤波器抑制特征图中的噪声与伪影,同时保留形状与结构信息,尤其在困难区域表现更优。
  • 结合领域归一化与非局部滤波,增强特征鲁棒性,并在域偏移下提升匹配精度。
  • 在无需任何真实域数据或微调的情况下训练模型,完全依赖合成数据实现对真实测试场景的泛化。

实验结果

研究问题

  • RQ1能否训练一个立体匹配网络,使其在无需微调或适应的情况下,有效泛化至未见的真实世界场景?
  • RQ2如何对特征表征进行正则化,使其对光照、对比度和纹理变化等域偏移具有不变性?
  • RQ3可学习的非局部图基滤波器在跨域设置下,能在多大程度上提升立体匹配特征的鲁棒性?
  • RQ4仅在合成数据上训练的模型能否在真实世界基准(如KITTI 2015)上超越微调后的模型?
  • RQ5领域归一化与非局部滤波的结合是否能带来更好的泛化性能并减少伪影?

主要发现

  • DSMNet在仅使用合成数据训练的情况下,于KITTI 2015基准上达到3.71%的测试误差率,优于所有最先进的零样本跨域泛化模型。
  • 该模型在KITTI 2015基准上超越了微调后的深度学习模型(如MC-CNN,3.89%;DispNetC,4.34%;content-CNN,4.54%),且无需任何适应操作。
  • 在四个真实世界数据集上,DSMNet相较于在相同合成数据上训练的最先进模型,将误差率降低了3%至30%。
  • 在KITTI 2015上微调700个周期后,DSMNet在非遮挡区域达到1.71%的新最先进误差率,在完整区域达到1.90%。
  • 将所提出的非局部滤波层加入GANet-deep后,KITTI 2015上的误差率降低至1.77%,创下新SOTA,证明该方法在域自适应设置下依然有效。
  • 在定性对比中,DSMNet生成的物体边界比微调后的模型(如PSMNet和GANet-deep)更准确。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。