Skip to main content
QUICK REVIEW

[论文解读] Attention Concatenation Volume for Accurate and Efficient Stereo Matching

Gangwei Xu, Junda Cheng|arXiv (Cornell University)|Mar 4, 2022
Advanced Vision and Imaging被引用 10
一句话总结

本文提出了一种新型的代价体积构建方法——注意力拼接体积(ACV),通过基于互相关性的注意力权重过滤拼接体积中的冗余内容,显著减少了对重型3D卷积聚合的需求。通过集成多层级自适应块匹配以实现鲁棒的相似性估计,ACV使轻量级聚合网络成为可能——在仅使用GwcNet 1/25参数量的情况下达到最先进精度,ACVNet在KITTI 2012/2015上排名第二,在Scene Flow上排名第二,在ETH3D上排名第三,且具有更优的运行速度。

ABSTRACT

Stereo matching is a fundamental building block for many vision and robotics applications. An informative and concise cost volume representation is vital for stereo matching of high accuracy and efficiency. In this paper, we present a novel cost volume construction method which generates attention weights from correlation clues to suppress redundant information and enhance matching-related information in the concatenation volume. To generate reliable attention weights, we propose multi-level adaptive patch matching to improve the distinctiveness of the matching cost at different disparities even for textureless regions. The proposed cost volume is named attention concatenation volume (ACV) which can be seamlessly embedded into most stereo matching networks, the resulting networks can use a more lightweight aggregation network and meanwhile achieve higher accuracy, e.g. using only 1/25 parameters of the aggregation network can achieve higher accuracy for GwcNet. Furthermore, we design a highly accurate network (ACVNet) based on our ACV, which achieves state-of-the-art performance on several benchmarks.

研究动机与目标

  • 为解决现有代价体积表示中的低效性与冗余性,特别是拼接体积中包含过多未经过滤的内容信息的问题。
  • 通过一种新颖的多层级自适应块匹配策略,提升在无纹理和低对比度区域的相似性度量可靠性,从而改善匹配精度。
  • 通过利用来自互相关体积的注意力权重对拼接体积进行过滤,降低代价聚合的计算负担。
  • 设计一种通用、可插拔的代价体积模块(ACV),在多种立体匹配网络中提升精度与效率。
  • 在极低推理成本下实现最先进性能,展示在真实世界与合成基准数据集上的强大泛化能力。

提出的方法

  • 提出注意力拼接体积(ACV),从左、右特征图构建初始拼接体积,并应用从互相关体积中提取的注意力权重,以抑制冗余特征。
  • 引入多层级自适应块匹配,通过使用可学习自适应权重的可变尺寸块,在不同特征层级上计算更精确的相似性度量,尤其在无纹理区域表现更优。
  • 利用互相关体积作为关键,生成具有空间感知能力的注意力权重,突出拼接体积中与匹配相关的关键区域,提升特征过滤的精确度。
  • 通过用基于注意力的过滤替代传统的重型3D卷积,设计轻量级聚合网络,与GwcNet相比,参数量最多减少25倍。
  • 构建ACVNet,一种完整的立体匹配网络,围绕ACV模块设计,其主干网络与聚合模块均针对精度与速度进行了优化。
  • 采用两阶段训练策略:在合成数据(Scene Flow)上预训练注意力模块,并在真实世界数据集(KITTI、ETH3D)上进行微调。

实验结果

研究问题

  • RQ1源自互相关体积的注意力机制能否有效抑制基于拼接的代价体积中的冗余信息?
  • RQ2多层级自适应块匹配能否提升在无纹理及挑战性区域的相似性度量精度?
  • RQ3结合注意力增强的代价体积后,轻量级聚合网络能否实现最先进精度?
  • RQ4所提出的ACV模块是否能在包括合成与真实世界数据集在内的多样化立体匹配基准上实现良好泛化?
  • RQ5基于ACV的网络能否在保持低推理延迟的同时实现高精度,尤其在实时应用中?

主要发现

  • ACVNet在KITTI 2012与KITTI 2015基准中均位列第二,在Scene Flow中排名第二,在ETH3D中位列第三,展现出跨数据集的强大泛化能力。
  • 仅使用GwcNet聚合网络1/25的参数量,ACV-based模型的精度仍高于使用28个3D卷积的GwcNet。
  • 在将GwcNet的联合体积替换为ACV后,仅需四个3D卷积即可超越GwcNet的性能,显著降低计算成本。
  • ACVNet是KITTI基准中Top 10方法中运行最快的,以仅0.2秒的推理时间实现高精度。
  • ACVNet-Fast实现了最先进水平的实时性能,在Kitti与Scene Flow上的速度与精度均优于现有实时方法。
  • 在Scene Flow上,ACVNet相比LEAStereo将EPE降低38.4%,且运行速度更快33%(0.2秒 vs. 0.3秒),展现出更优的效率-精度权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。