Skip to main content
QUICK REVIEW

[论文解读] Content-Aware Inter-Scale Cost Aggregation for Stereo Matching

Chengtang Yao, Yunde Jia|arXiv (Cornell University)|Jun 5, 2020
Advanced Vision and Imaging参考文献 37被引用 5
一句话总结

本文提出了一种用于立体匹配的内容感知跨尺度代价聚合方法,通过从左右视图学习动态滤波器权重,自适应地上采样并聚合多尺度代价体积,从而实现更优的细节恢复。通过显式编码空间关系并将三维聚合分解为二维和一维操作,该方法在减少计算量的同时,在 Scene Flow、KITTI2015 和 Middlebury 数据集上优于当前最先进方法。

ABSTRACT

Cost aggregation is a key component of stereo matching for high-quality depth estimation. Most methods use multi-scale processing to downsample cost volume for proper context information, but will cause loss of details when upsampling. In this paper, we present a content-aware inter-scale cost aggregation method that adaptively aggregates and upsamples the cost volume from coarse-scale to fine-scale by learning dynamic filter weights according to the content of the left and right views on the two scales. Our method achieves reliable detail recovery when upsampling through the aggregation of information across different scales. Furthermore, a novel decomposition strategy is proposed to efficiently construct the 3D filter weights and aggregate the 3D cost volume, which greatly reduces the computation cost. We first learn the 2D similarities via the feature maps on the two scales, and then build the 3D filter weights based on the 2D similarities from the left and right views. After that, we split the aggregation in a full 3D spatial-disparity space into the aggregation in 1D disparity space and 2D spatial space. Experiment results on Scene Flow dataset, KITTI2015 and Middlebury demonstrate the effectiveness of our method.

研究动机与目标

  • 解决固定上采样方法在立体匹配中因粗尺度处理导致细节丢失的局限性。
  • 通过利用左右视图特征进行内容感知权重学习,而非依赖单视图引导,从而提升代价聚合质量。
  • 通过将完整的三维操作分解为可分离的二维和一维组件,降低三维代价体积聚合中的计算成本。
  • 通过基于立体视图相似性的学习动态、内容自适应滤波器权重,实现在上采样过程中可靠地恢复细节。

提出的方法

  • 该方法利用不同尺度下左右视图的配对特征图学习内容感知滤波器权重,通过特征图偏移和位置图显式编码空间关系。
  • 通过将偏移后的特征图与位置图拼接作为输入送入1×1卷积层,引入显式的空间关系编码,替代大感受野卷积。
  • 提出一种新颖的分解策略,将三维代价体积聚合分解为二维空间相似性学习和一维视差相关变形,显著降低内存与计算开销。
  • 通过视差感知变形从学习到的二维相似性动态构建三维滤波器权重,避免直接学习三维权重。
  • 仅使用1×1卷积生成权重,相比先前需要更深网络或更大卷积核的方法,显著提升了效率。
  • 该方法被集成到基于PSMNet的框架中,用学习到的自适应上采样替代标准反卷积或插值操作。

实验结果

研究问题

  • RQ1能否有效利用立体视图对来学习用于跨尺度代价聚合的内容感知权重,从而在细节恢复方面优于单视图引导?
  • RQ2显式编码左右视图像素之间的空间关系是否能带来比通过大感受野隐式编码更优的性能与效率?
  • RQ3能否在不损失精度的前提下,高效地将三维代价体积聚合分解为二维和一维操作?
  • RQ4与固定权重上采样方法(如双线性或反卷积)相比,所提方法在保持视差估计中的精细细节方面表现如何?

主要发现

  • 在 Middlebury-v3 数据集上,所提方法在所有对比方法中表现最佳,EPE 指标误差率为 59.7%,优于 PSMNet-ROB(67.3%)和 DeepPruner-ROB(57.1%)。
  • 该方法显著降低了计算成本:推理时仅需 0.28 GFLOPs,低于 PSMNet-ROB(0.64 GFLOPs)和 AMNet(0.4 GFLOPs),且精度更高。
  • 在 KITTI2015 数据集上,该方法在 EPE 指标上达到 13.7% 的误差率,优于 PSMNet-ROB(23.5%)和 DeepPruner-ROB(15.9%),展现出更高的精度。
  • Middlebury-v3 上的可视化结果表明,在细粒度细节恢复方面具有明显优势,尤其在红色框区域,其他方法无法保持纹理与边缘结构。
  • 消融实验验证了显式空间编码与基于立体视图的权重学习的有效性,相比隐式编码与单视图引导,性能提升显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。