Skip to main content
QUICK REVIEW

[论文解读] Revisiting Stereo Depth Estimation From a Sequence-to-Sequence Perspective with Transformers

Zhaoshuo Li, Xingtong Liu|arXiv (Cornell University)|Nov 5, 2020
Advanced Vision and Imaging被引用 4
一句话总结

本文提出 STTR,一种基于 Transformer 的立体深度估计方法,将问题重新构型为使用注意力机制的序列到序列匹配任务,取代传统的代价体积构建。通过引入相对位置编码的自注意力与交叉注意力机制,结合基于最优传输的匹配策略,STTR 实现了灵活的视差范围估计,能够检测遮挡区域并输出置信度分数,同时强制执行唯一性约束,在合成数据与真实世界基准上均取得当前最优性能,参数量极低,并展现出强大的零样本泛化能力。

ABSTRACT

Stereo depth estimation relies on optimal correspondence matching between pixels on epipolar lines in the left and right images to infer depth. In this work, we revisit the problem from a sequence-to-sequence correspondence perspective to replace cost volume construction with dense pixel matching using position information and attention. This approach, named STereo TRansformer (STTR), has several advantages: It 1) relaxes the limitation of a fixed disparity range, 2) identifies occluded regions and provides confidence estimates, and 3) imposes uniqueness constraints during the matching process. We report promising results on both synthetic and real-world datasets and demonstrate that STTR generalizes across different domains, even without fine-tuning.

研究动机与目标

  • 为克服基于深度学习的立体深度估计中固定视差范围约束的局限性。
  • 实现端到端的稠密像素对应学习,同时满足唯一性等几何约束。
  • 为视差预测提供置信度估计,以提升下游场景理解能力。
  • 开发一种内存高效的基于 Transformer 的架构,实现跨领域泛化而无需微调。
  • 以基于注意力的稠密匹配替代代价体积构建,提升鲁棒性与灵活性。

提出的方法

  • STTR 使用共享特征提取器,从左右立体图像中生成图像嵌入。
  • 通过交替使用自注意力与交叉注意力的 Transformer 编码器,计算跨视差线的稠密显式像素匹配。
  • 将相对像素距离编码注入特征描述符,以提升匹配判别能力并解决歧义。
  • 采用最优传输理论强制匹配唯一性,防止多个像素被分配到三维空间中的同一点。
  • 通过上下文调整模块,利用左图中视差线上的上下文信息对原始视差预测进行精细化调整。
  • 通过优化注意力计算与特征分辨率,实现内存高效的实现,使模型可在标准硬件上进行训练。

实验结果

研究问题

  • RQ1基于序列到序列的 Transformer 方法是否能在放松固定视差范围约束的前提下,超越基于代价体积的方法?
  • RQ2结合相对位置编码的注意力机制是否能有效替代密集立体匹配中的手工设计代价体积?
  • RQ3模型是否能在无额外监督的情况下检测遮挡区域并提供置信度估计?
  • RQ4模型是否能在无微调的情况下实现跨领域泛化(如从合成数据到真实世界数据)?
  • RQ5基于 Transformer 的架构是否能以更少参数和更低内存消耗实现具有竞争力的性能?

主要发现

  • STTR 在 Scene Flow、MPI Sintel、KITTI 2015、Middlebury 2014 和 SCARED 基准上均达到当前最优性能,且无需任何领域特定的微调。
  • 当仅在合成的 Scene Flow 数据上训练时,模型对真实世界数据集(如 KITTI 2015 和 Middlebury 2014)具有出色的泛化能力。
  • STTR 在 Scene Flow 上的中位绝对误差为 0.76 px,在 KITTI 2015 上为 0.82 px,两项指标均优于先前方法。
  • 模型仅使用 2.5M 参数,是目前参数效率最高的立体匹配网络之一,甚至优于 NAS 优化的模型(如 LEAStereo)。
  • 推理内存占用显著低于 PSMNet 和 AANet,STTR 在最大视差为 192 的 960×576 图像上仅需 3.8 GB 内存。
  • 在最大视差为 192、分辨率为 960×576 的条件下,STTR 的推理速度达到 5.77 Hz,轻量化版本的内存占用仅为 2.0 GB。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。