[论文解读] Left-Right Comparative Recurrent Model for Stereo Matching
该论文提出了一种新颖的端到端左-右对比循环(LRCR)模型,通过带有软注意力机制的循环架构,联合执行立体匹配视差估计与左-右一致性检查。通过迭代地利用在线左-右对比和注意力引导的不可靠区域聚焦来优化视差图,LRCR在KITTI 2015、Scene Flow和Middlebury基准上实现了最先进性能,仅使用30M参数,优于先前方法,同时保持高效的推理速度。
Leveraging the disparity information from both left and right views is crucial for stereo disparity estimation. Left-right consistency check is an effective way to enhance the disparity estimation by referring to the information from the opposite view. However, the conventional left-right consistency check is an isolated post-processing step and heavily hand-crafted. This paper proposes a novel left-right comparative recurrent model to perform left-right consistency checking jointly with disparity estimation. At each recurrent step, the model produces disparity results for both views, and then performs online left-right comparison to identify the mismatched regions which may probably contain erroneously labeled pixels. A soft attention mechanism is introduced, which employs the learned error maps for better guiding the model to selectively focus on refining the unreliable regions at the next recurrent step. In this way, the generated disparity maps are progressively improved by the proposed recurrent model. Extensive evaluations on KITTI 2015, Scene Flow and Middlebury benchmarks validate the effectiveness of our model, demonstrating that state-of-the-art stereo disparity estimation results can be achieved by this new model.
研究动机与目标
- 为解决传统左-右一致性检查方法存在的后处理、手工设计且因依赖浅层特征而脆弱的局限性。
- 将视差估计与一致性检查统一到一个单一的端到端可训练的循环框架中,实现相互提升。
- 开发一种自学习机制,能够自动识别并优化不可靠区域,利用学习到的误差图作为软注意力引导。
- 在减少对大规模训练数据和复杂架构依赖的前提下,实现更优的视差估计性能。
提出的方法
- LRCR模型基于ConvLSTM构建循环架构,在每一步并行处理左右视图,保持携带历史视差估计的隐藏状态。
- 在每个循环步骤中,模型为两个视图生成视差图,并执行在线左-右对比,生成指示错位区域的误差图。
- 误差图被用作软注意力图,引导网络在后续优化步骤中更关注潜在错误、高风险区域。
- 模型采用混合恒定高速公路网络进行匹配代价学习,并堆叠多层ConvLSTM以逐步优化视差预测。
- 循环设计使网络能够通过可微分、端到端的方式,利用上下文信息与一致性检查,迭代改进预测。
- 训练过程采用两阶段学习策略,包括使用Scene Flow的预训练权重在较小数据集(如Middlebury)上进行微调。
实验结果
研究问题
- RQ1端到端循环模型能否有效整合左-右一致性检查与视差估计,以提升精度?
- RQ2基于学习误差图的在线、迭代优化,与传统后处理一致性检查相比有何优势?
- RQ3基于左-右对比的软注意力机制能否提升模型在无纹理、遮挡或反光区域检测与纠正错误的能力?
- RQ4LRCR模型在标准立体匹配基准上的性能相比最先进方法有何提升?
主要发现
- LRCR模型在KITTI 2015基准上达到最先进性能,优于先前方法,包括依赖更大规模训练数据集的端到端模型。
- 在Scene Flow数据集上,LRCR模型显著优于最先进方法GC-NET,且在各循环步骤中均表现出一致的性能提升。
- 在Middlebury基准上,LRCR模型超越了非循环基线模型以及MC-CNN-acrt(一种强基准方法),在室内场景中展现出优异的泛化能力。
- 随着循环步骤增加,模型表现出渐进式性能提升趋势,相对增益随时间递减,表明已收敛至稳定且高质量的预测结果。
- 尽管仅使用30M参数,LRCR模型在性能上可与参数量更大的模型(如CRL,74.95M参数)相媲美,体现出极高的参数效率。
- LRCR模型在保持与基线方法相近推理时间的同时,显著提升了精度,表明其具备实际效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。