Skip to main content
QUICK REVIEW

[论文解读] SegStereo: Exploiting Semantic Information for Disparity Estimation

Guorun Yang, Hengshuang Zhao|arXiv (Cornell University)|Jul 31, 2018
Advanced Vision and Imaging参考文献 32被引用 6
一句话总结

本文提出 SegStereo,一种统一的深度学习框架,通过将语义分割特征整合到立体匹配视差估计中,以提高准确性,尤其在模糊、无纹理区域表现更优。通过引入语义特征嵌入和语义 Softmax 损失进行正则化,该方法在监督和无监督训练中均表现增强,在 KITTI 立体基准上达到最先进性能,并在 CityScapes 和 FlyingThings3D 上取得优异结果。

ABSTRACT

Disparity estimation for binocular stereo images finds a wide range of applications. Traditional algorithms may fail on featureless regions, which could be handled by high-level clues such as semantic segments. In this paper, we suggest that appropriate incorporation of semantic cues can greatly rectify prediction in commonly-used disparity estimation frameworks. Our method conducts semantic feature embedding and regularizes semantic cues as the loss term to improve learning disparity. Our unified model SegStereo employs semantic features from segmentation and introduces semantic softmax loss, which helps improve the prediction accuracy of disparity maps. The semantic cues work well in both unsupervised and supervised manners. SegStereo achieves state-of-the-art results on KITTI Stereo benchmark and produces decent prediction on both CityScapes and FlyingThings3D datasets.

研究动机与目标

  • 解决传统方法因缺乏局部特征而在纹理缺失或模糊区域中视差估计不准确的挑战。
  • 探究高层语义线索是否能在监督和无监督学习设置中引导并稳定视差预测。
  • 开发一个统一框架,联合优化语义分割与视差估计,以提升鲁棒性和准确性。
  • 评估语义正则化在减少复杂真实世界立体数据集上预测误差方面的有效性。
  • 展示该方法在 KITTI、CityScapes 和 FlyingThings3D 等多样化数据集上的泛化能力。

提出的方法

  • 使用基于 ResNet 的编码器结合相关层进行特征提取和视差估计中的代价体积计算。
  • 集成一个分割子网络,生成空间对齐的语义特征图,并将其嵌入到视差预测分支中。
  • 应用语义 Softmax 损失,通过强制匹配像素间的语义一致性来正则化预测。
  • 通过使视差和语义评估均完全卷积化,实现端到端训练。
  • 支持监督和无监督训练:在无监督模式下,结合光度一致性损失与语义 Softmax 损失;在监督模式下,用回归损失替代光度损失。
  • 在 KITTI 上通过重新设计架构(如增加深层特征提取层 'conv1_3' 和 'conv5_4')以及增大相关层卷积核大小(96)对模型进行微调。

实验结果

研究问题

  • RQ1语义线索是否能在传统方法失效的模糊、低纹理区域显著提升视差估计性能?
  • RQ2语义特征嵌入在不同训练范式(监督 vs. 无监督)下,是否能有效增强视差预测的鲁棒性?
  • RQ3通过 Softmax 损失引入语义一致性,是否能提升在多样化立体数据集上的泛化能力?
  • RQ4统一模型能否有效实现视差估计与语义分割组件的端到端联合训练?
  • RQ5所提方法在 KITTI、CityScapes 和 FlyingThings3D 等标准基准上与最先进方法相比表现如何?

主要发现

  • SegStereo 在 KITTI 立体 2015 基准上达到最先进性能,平均端到端误差(EPE)为 1.76,D1 错误率为 3.70。
  • 在 KITTI 2012 基准上,模型将 EPE 降低至 1.88,D1 降低至 4.07,在具有挑战性的区域表现优于以往方法。
  • SegStereo 的无监督版本在 CityScapes 上超越经典 SGM 方法,展现出强大的零样本泛化能力。
  • 在 FlyingThings3D 数据集上,监督版 SegStereo 模型实现 EPE 1.45 和 D1 3.50,优于 ResNetCorr(EPE: 3.50, D1: 8.45)及其他最先进方法。
  • 经改进的 SegStereo 模型(增强特征提取,corr13)在 KITTI 2015 上将 EPE 降低至 1.88,D1 降低至 4.07,显示出更优的细节保留能力。
  • 视觉结果表明,通过利用语义一致性,SegStereo 在道路中线和车辆区域等模糊区域生成了更准确的视差图。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。