[论文解读] COTR: Correspondence Transformer for Matching Across Images
COTR 提出了一种基于 Transformer 的对应网络,通过函数映射在图像之间预测稀疏或密集对应关系,利用多尺度推理和自注意力机制建模局部与全局先验。该方法在无需微调的情况下,在多种任务(包括宽基线立体视觉、光流估计和以物体为中心的场景)中均实现了最先进性能。
We propose a novel framework for finding correspondences in images based on a deep neural network that, given two images and a query point in one of them, finds its correspondence in the other. By doing so, one has the option to query only the points of interest and retrieve sparse correspondences, or to query all points in an image and obtain dense mappings. Importantly, in order to capture both local and global priors, and to let our model relate between image regions using the most relevant among said priors, we realize our network using a transformer. At inference time, we apply our correspondence network by recursively zooming in around the estimates, yielding a multiscale pipeline able to provide highly-accurate correspondences. Our method significantly outperforms the state of the art on both sparse and dense correspondence problems on multiple datasets and tasks, ranging from wide-baseline stereo to optical flow, without any retraining for a specific dataset. We commit to releasing data, code, and all the tools necessary to train from scratch and ensure reproducibility.
研究动机与目标
- 通过将稀疏与密集对应方法统一于单一可微分框架下,弥合两者之间的差距。
- 实现对任意查询点的准确对应预测,支持稀疏与密集推理。
- 利用注意力机制建模复杂对应模式,包括由三维几何导致的不连续性。
- 开发一种递归多尺度推理策略,通过迭代优化提升定位精度。
- 在无需微调或架构修改的情况下,实现对不同数据集和任务的泛化能力。
提出的方法
- COTR 将对应关系建模为函数映射:$ x' = \mathcal{F}_{\Phi}(x \mid I, I') $,其中 $ \mathcal{F}_{\Phi} $ 是一个基于 Transformer 的网络,给定第一幅图像中的查询点 $ x $,预测其在第二幅图像中的对应点 $ x' $。
- 模型通过查询位置与图像特征之间的交叉注意力机制,关注相关的全局与局部上下文,从而能够处理大位移和复杂运动。
- 在推理阶段应用递归缩放机制:模型通过聚焦于估计对应点周围的更小区域,逐步细化预测,从而提高精度。
- 网络采用可微损失函数进行训练,以最小化预测对应点与真实对应点之间的端到端像素误差(EPE)。
- 在预测后应用过滤机制,以去除低置信度的对应点,从而提升密集插值的质量。
- 通过将 Transformer 替换为多层感知机(MLP)进行消融实验,证明注意力机制在建模不连续对应关系中的必要性。
实验结果
研究问题
- RQ1单一深度学习框架是否能在不进行架构或训练配置调整的情况下,有效处理稀疏与密集对应任务?
- RQ2与全连接或 MLP 基础模型相比,Transformer 中的自注意力机制在存在几何不连续性时,如何提升对应估计性能?
- RQ3递归多尺度细化在多大程度上提升了对应预测的精度?
- RQ4该模型是否能在未见过的数据集和运动类型(如多物体运动或物体姿态变化)上实现泛化,而无需微调?
- RQ5过滤低置信度对应点对密集对应图质量有何影响?
主要发现
- COTR 在 HPatches、KITTI、ETH3D 和 IMC2020 数据集上,对稀疏与密集对应任务均实现了最先进性能,且无需任何微调。
- 在 HPatches 数据集上,COTR 仅使用 512 个输入匹配点即超越 SuperGlue(2k 关键点类别冠军),且在仅 256 个匹配点时也优于 DISK(亚军)。
- 递归缩放策略显著降低了端到端像素误差(EPE),误差分布向左移动,并在更高缩放层级上更加集中。
- 消融实验表明,将 Transformer 替换为 MLP 会导致全局平滑但几何上不准确的预测,尤其在物体边界处表现更差。
- 在 ETH3D 数据集上,过滤低质量对应点使 AEPE 相对提升约 5%,且平均仅移除 1.2% 的预测结果。
- 定性结果表明,COTR 能够成功捕捉复杂的运动模式,如物体互换与非平面三维结构,而基线方法如 GLU-Net 则失败。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。