[论文解读] Multi-Frame Self-Supervised Depth with Transformers
本文提出DepthFormer,一种基于Transformer的架构,通过深度离散化的对极采样和自注意力与交叉注意力机制,改进了多帧自监督单目深度估计中的特征匹配。该方法在KITTI和DDAD数据集上实现了最先进性能,优于多种自监督多帧方法及监督单帧模型,且学习到的注意力表征具有良好的跨数据集迁移能力。
Multi-frame depth estimation improves over single-frame approaches by also leveraging geometric relationships between images via feature matching, in addition to learning appearance-based features. In this paper we revisit feature matching for self-supervised monocular depth estimation, and propose a novel transformer architecture for cost volume generation. We use depth-discretized epipolar sampling to select matching candidates, and refine predictions through a series of self- and cross-attention layers. These layers sharpen the matching probability between pixel features, improving over standard similarity metrics prone to ambiguities and local minima. The refined cost volume is decoded into depth estimates, and the whole pipeline is trained end-to-end from videos using only a photometric objective. Experiments on the KITTI and DDAD datasets show that our DepthFormer architecture establishes a new state of the art in self-supervised monocular depth estimation, and is even competitive with highly specialized supervised single-frame architectures. We also show that our learned cross-attention network yields representations transferable across datasets, increasing the effectiveness of pre-training strategies. Project page: https://sites.google.com/tri.global/depthformer
研究动机与目标
- 通过注意力机制增强多帧特征匹配,提升自监督单目深度估计性能。
- 解决传统基于相似度的代价体积构建方法存在的问题,如无纹理或动态区域导致的模糊性和局部极小值。
- 设计一种基于几何原理的注意力机制,以优化匹配概率,提升深度预测精度。
- 实现学习到的匹配函数在不同数据集间的可迁移性,提升预训练效率与收敛速度。
- 在无需真实深度监督或显式监督的情况下,实现最先进性能。
提出的方法
- 该方法使用深度离散化的对极采样,生成目标图像与上下文图像特征之间的候选匹配。
- 提出一种新型基于Transformer的模块,通过自注意力与交叉注意力机制,对每像素的匹配概率进行精细化处理,使其优于标准相似度度量。
- 利用高响应窗口滤波对优化后的代价体积进行解码,生成深度图,并与单帧特征融合以增强鲁棒性。
- 整个流程通过视频序列的光度重建损失进行端到端训练,无需任何监督信号。
- 注意力机制的设计具有几何基础,可提升复杂场景中对应关系的准确性。
- 模型同时利用多帧几何线索与单帧外观特征,以应对动态物体或缺乏运动等失败情况。
实验结果
研究问题
- RQ1自注意力与交叉注意力机制是否能提升多帧自监督深度估计中特征匹配的可靠性?
- RQ2基于Transformer的代价体积优化是否优于标准基于相似度的方法?
- RQ3学习到的基于注意力的匹配函数是否可在不同数据集间有效迁移?
- RQ4自监督多帧方法在多大程度上可超越监督单帧架构?
- RQ5单帧特征的引入在低置信度或模糊区域中如何提升模型鲁棒性?
主要发现
- DepthFormer在KITTI与DDAD基准上实现了自监督单目深度估计的最先进性能。
- 该模型优于现有自监督多帧方法,甚至超越了如BTS等若干监督单帧架构。
- 在KITTI数据集上,该方法在半分辨率(640×192)下达到与BTS相当的性能,在全分辨率(1216×352)下则表现更优。
- 学习到的基于注意力的匹配函数展现出强大的跨数据集迁移能力,显著加快预训练收敛速度并降低内存消耗。
- 定性结果表明,即使在低纹理与动态区域,也能准确重建点云与深度图,且无需任何真实深度监督。
- 该方法能有效识别并掩码低置信度区域(如天空、遮挡区域),并通过与单帧特征的上下文感知融合实现有效恢复。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。