[论文解读] Transformer-Based Attention Networks for Continuous Pixel-Wise Prediction
本文提出 TransDepth,一种用于连续像素级预测任务(如单目深度估计和表面法线估计)的混合 CNN-Transformer 架构。通过将统一的注意力门解码器集成到引入视觉 Transformer 块增强的 ResNet 主干网络中,TransDepth 有效建模了长距离依赖关系,同时保留了局部细节,在 NYU、KITTI 和 ScanNet 基准测试中实现了最先进性能。
While convolutional neural networks have shown a tremendous impact on various computer vision tasks, they generally demonstrate limitations in explicitly modeling long-range dependencies due to the intrinsic locality of the convolution operation. Initially designed for natural language processing tasks, Transformers have emerged as alternative architectures with innate global self-attention mechanisms to capture long-range dependencies. In this paper, we propose TransDepth, an architecture that benefits from both convolutional neural networks and transformers. To avoid the network losing its ability to capture local-level details due to the adoption of transformers, we propose a novel decoder that employs attention mechanisms based on gates. Notably, this is the first paper that applies transformers to pixel-wise prediction problems involving continuous labels (i.e., monocular depth prediction and surface normal estimation). Extensive experiments demonstrate that the proposed TransDepth achieves state-of-the-art performance on three challenging datasets. Our code is available at: https://github.com/ygjwd12345/TransDepth.
研究动机与目标
- 解决卷积神经网络在密集预测任务中建模长距离空间依赖关系的局限性。
- 克服在像素级回归任务中使用纯 Transformer 时导致的局部归纳偏差损失问题。
- 提出一种新颖的注意力门解码器,用于融合多尺度特征并增强解码器中的特征表示。
- 证明结合 CNN 与 Transformer 用于连续标签预测的有效性,特别是在单目深度估计和表面法线估计任务中。
- 在深度和法线估计任务的标准基准数据集上建立新的最先进性能。
提出的方法
- 将视觉 Transformer 块集成到 ResNet-50 主干网络中,以增强全局上下文建模能力,同时保留局部空间归纳偏差。
- 提出一种统一的注意力门解码器,通过分别应用通道注意力和空间注意力机制来融合多尺度特征。
- 使用门控注意力机制,动态加权不同尺度的特征图,从而改善特征传播与表征学习。
- 采用多尺度特征融合策略,使解码器接收来自编码器多个阶段(如 f³, f⁴, f⁵)的特征,以增强上下文信息。
- 利用自注意力机制对特征图中所有像素之间的长距离依赖关系进行建模,实现全局上下文建模。
- 使用标准回归损失函数对网络进行端到端训练,适用于深度和法线估计任务。
实验结果
研究问题
- RQ1Transformer 能否有效应用于单目深度估计和表面法线估计等连续像素级预测任务?
- RQ2如何将 Transformer 的全局建模能力与 CNN 的局部归纳偏差相结合,以提升密集预测性能?
- RQ3如何设计一种最优的解码器,以在保持空间与通道注意力的同时融合多尺度特征,从而实现更优的表征?
- RQ4所提出的统一注意力门解码器是否在捕捉长距离与局部依赖关系方面优于标准注意力或基于跳跃连接的解码器?
- RQ5该混合 CNN-Transformer 架构能否在 NYU、KITTI 和 ScanNet 等标准基准上实现最先进性能?
主要发现
- 在 NYU 数据集上,TransDepth 在 δ < 1.25 指标上实现了 0.900 的新最先进性能,用于单目深度估计。
- 在 KITTI 数据集上,TransDepth 在 δ < 1.25 指标上达到 0.956,创下深度预测的新 SOTA 记录。
- 在 NYU 数据集的表面法线估计任务中,TransDepth 在 11.25° 指标上达到 61.7%,建立了新的 SOTA 结果。
- 消融实验表明,融合三个编码器特征(f³, f⁴, f⁵)可获得最佳性能,进一步扩展则导致过拟合。
- 在 NYU 深度数据集上,ResNet-50 与 ViT-B/16 的混合主干网络在所有指标上均优于纯 ResNet 和纯 ViT 主干网络。
- 定性注意力图显示,注意力门解码器成功捕捉了图像不同区域之间的多尺度空间依赖关系。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。