Skip to main content
QUICK REVIEW

[论文解读] SymmNet: A Symmetric Convolutional Neural Network for Occlusion Detection

Ang Li, Zejian Yuan|arXiv (Cornell University)|Jul 2, 2018
Advanced Vision and Imaging被引用 8
一句话总结

本文提出 SymmNet,一种对称卷积神经网络,可直接检测立体图像和视频序列中的遮挡,而无需依赖预计算的视差或光流。通过利用左右视图对称性联合推理双目遮挡,SymmNet 在立体和运动遮挡检测基准上均达到最先进性能,F-score 和鲁棒性均优于先前方法。

ABSTRACT

Detecting the occlusion from stereo images or video frames is important to many computer vision applications. Previous efforts focus on bundling it with the computation of disparity or optical flow, leading to a chicken-and-egg problem. In this paper, we leverage convolutional neural network to liberate the occlusion detection task from the interleaved, traditional calculation framework. We propose a Symmetric Network (SymmNet) to directly exploit information from an image pair, without estimating disparity or motion in advance. The proposed network is structurally left-right symmetric to learn the binocular occlusion simultaneously, aimed at jointly improving both results. The comprehensive experiments show that our model achieves state-of-the-art results on detecting the stereo and motion occlusion.

研究动机与目标

  • 为解决遮挡检测中的鸡肋问题,即视差或光流估计需要遮挡信息,但遮挡本身又会阻碍视差或光流的估计。
  • 通过直接从原始图像对中学习遮挡,消除对中间视差或运动计算的依赖。
  • 通过联合建模左、右视图的对称网络架构,提升遮挡检测的准确性。
  • 通过统一框架在立体和运动遮挡检测任务中实现泛化能力。

提出的方法

  • SymmNet 采用沙漏形状的、左右对称的卷积神经网络架构,同时处理立体图像对。
  • 网络端到端训练,直接从图像对预测二值遮挡图,跳过视差或运动估计步骤。
  • 左右对称性确保了不同视图间遮挡预测的一致性,提升了特征学习能力和鲁棒性。
  • 采用类别加权交叉熵损失,ε = 1.2,以处理类别不平衡问题,尤其在遮挡稀疏的数据集中。
  • 在 Middlebury 数据集上使用 50 个周期的学习率调度策略进行微调,初始学习率降低至 1×10⁻³。
  • 通过将连续视频帧作为输入,将架构适配至运动遮挡检测,同时保持相同的对称设计。

实验结果

研究问题

  • RQ1能否在不依赖预计算视差或光流的前提下,直接从立体图像中检测遮挡?
  • RQ2CNN 架构中的左右对称性如何提升双目遮挡检测的准确性和一致性?
  • RQ3单一对称网络能否在立体和运动遮挡检测任务中实现泛化?
  • RQ4在基准数据集上,SymmNet 与最先进方法相比,其 F-score、精确率和召回率表现如何?
  • RQ5对称设计是否增强了对相机配置和光照条件变化的鲁棒性?

主要发现

  • 在 SceneFlow 立体遮挡基准上,SymmNet 的 F-score 达到 0.873,优于先前方法如 MC-CNN + LRC(F-score 0.802)。
  • 在 Middlebury 数据集上微调后(SymmNet-MB),该模型在 MPI Sintel 运动遮挡基准上的 F-score 达到 0.828,超过所有对比方法。
  • 即使未进行微调,SymmNet 的性能仍可与最先进模型相媲美,展现出强大的跨数据集泛化能力。
  • 在 Tesla M40 GPU 上,模型每对图像的推理时间仅为 0.07 秒,内存占用仅 651MB,适用于实时应用。
  • 在 MPI Sintel 上的定性结果表明,即使在复杂运动序列中,模型也能准确检测细小且稀疏的遮挡区域。
  • 对称设计显著提升了预测的一致性和鲁棒性,尤其在光照和纹理条件复杂的情况下。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。