Skip to main content
QUICK REVIEW

[论文解读] Parallax Attention for Unsupervised Stereo Correspondence Learning

Longguang Wang, Yulan Guo|arXiv (Cornell University)|Sep 16, 2020
Advanced Vision and Imaging参考文献 70被引用 7
一句话总结

本文提出了一种通用的视差注意力机制(PAM),在无需固定最大视差的情况下,通过利用对极几何约束和基于注意力的特征匹配,学习在大视差变化下的立体对应关系。PAM在无监督立体匹配(PASMnet)和立体图像超分辨率(PASSRnet)任务中实现了最先进性能,并借助一个全新的大规模数据集Flickr1024支持训练与评估。

ABSTRACT

Stereo image pairs encode 3D scene cues into stereo correspondences between the left and right images. To exploit 3D cues within stereo images, recent CNN based methods commonly use cost volume techniques to capture stereo correspondence over large disparities. However, since disparities can vary significantly for stereo cameras with different baselines, focal lengths and resolutions, the fixed maximum disparity used in cost volume techniques hinders them to handle different stereo image pairs with large disparity variations. In this paper, we propose a generic parallax-attention mechanism (PAM) to capture stereo correspondence regardless of disparity variations. Our PAM integrates epipolar constraints with attention mechanism to calculate feature similarities along the epipolar line to capture stereo correspondence. Based on our PAM, we propose a parallax-attention stereo matching network (PASMnet) and a parallax-attention stereo image super-resolution network (PASSRnet) for stereo matching and stereo image super-resolution tasks. Moreover, we introduce a new and large-scale dataset named Flickr1024 for stereo image super-resolution. Experimental results show that our PAM is generic and can effectively learn stereo correspondence under large disparity variations in an unsupervised manner. Comparative results show that our PASMnet and PASSRnet achieve the state-of-the-art performance.

研究动机与目标

  • 为解决由于相机基线、焦距和分辨率变化导致的立体匹配中大视差变化问题。
  • 克服基于代价体积的方法中固定最大视差的局限性,这些局限性会限制在多样化立体图像对上的性能表现。
  • 开发一种通用且紧凑的注意力机制,将对极几何与特征注意力相结合,以实现精确的立体对应关系。
  • 将所提方法扩展至多个任务,包括立体匹配与立体图像超分辨率,实现最先进性能。

提出的方法

  • 提出一种视差注意力机制(PAM),通过矩阵乘法而非位移操作,在对极线上计算特征相似性。
  • 将对极几何约束整合进注意力机制中,聚焦于左右图像间最相似的特征,从而在大视差条件下实现鲁棒匹配。
  • 通过平滑性和循环一致性损失对注意力图进行直接正则化,避免视差回归中的歧义性。
  • 将PAM应用于构建PASMnet用于无监督立体匹配,以及PASSRnet用于立体图像超分辨率,两者均在无真实深度监督下进行训练。
  • 采用一种新型大规模数据集Flickr1024,包含1024对高质量立体图像,覆盖多样化场景与视差范围,用于训练与评估。
  • 利用矩阵运算避免显式视差回归,实现无硬编码视差范围限制的端到端学习。

实验结果

研究问题

  • RQ1深度学习方法是否能够在不依赖固定最大视差的前提下,稳健地学习大视差变化下的立体对应关系?
  • RQ2在无监督设置下,将对极几何与注意力机制结合,如何提升立体匹配的准确性?
  • RQ3所提出的视差注意力机制是否可泛化至多种立体视觉任务,如立体匹配与超分辨率?
  • RQ4在缺乏固定视差范围的情况下,对具有极端视差的立体图像对,性能提升程度如何?
  • RQ5与现有基于代价体积的方法相比,该方法在效率、准确性和跨多样化相机配置的泛化能力方面表现如何?

主要发现

  • 在小深度立体图像对上,PASSRnet的PSNR达到39.03 dB,比StereoSR高出1.43 dB。
  • 在大基线立体图像对上,PASSRnet相比StereoSR将PSNR提升了1.30 dB,展现出对大视差的鲁棒性。
  • PASMnet在无监督立体匹配任务中达到最先进性能,在KITTI数据集上相比基线方法PSNR提升1.20 dB。
  • PASSRnet降低了计算成本,并避免了在低分辨率图像上不必要的填充,效率高于StereoSR。
  • 所提出的Flickr1024数据集支持有效训练与评估,涵盖多样化场景类型与视差范围。
  • 消融实验证实,对注意力图进行直接正则化优于传统视差回归方法,能有效降低代价分布中的歧义性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。