[论文解读] TransMVSNet: Global Context-aware Multi-view Stereo Network with Transformers
TransMVSNet 提出了一种新颖的端到端多视角立体匹配网络,通过特征匹配 Transformer(FMT)利用自注意力与交叉注意力机制,在视图内部及跨视图之间捕捉长距离全局上下文。通过集成自适应感受野(ARF)模块与转换特征路径,实现了有效的特征优化与梯度流动,在 DTU、Tanks and Temples 和 BlendedMVS 基准上达到最先进性能,BlendedMVS 上的平均端点误差(EPE)为 0.73。
In this paper, we present TransMVSNet, based on our exploration of feature matching in multi-view stereo (MVS). We analogize MVS back to its nature of a feature matching task and therefore propose a powerful Feature Matching Transformer (FMT) to leverage intra- (self-) and inter- (cross-) attention to aggregate long-range context information within and across images. To facilitate a better adaptation of the FMT, we leverage an Adaptive Receptive Field (ARF) module to ensure a smooth transit in scopes of features and bridge different stages with a feature pathway to pass transformed features and gradients across different scales. In addition, we apply pair-wise feature correlation to measure similarity between features, and adopt ambiguity-reducing focal loss to strengthen the supervision. To the best of our knowledge, TransMVSNet is the first attempt to leverage Transformer into the task of MVS. As a result, our method achieves state-of-the-art performance on DTU dataset, Tanks and Temples benchmark, and BlendedMVS dataset. The code of our method will be made available at https://github.com/MegviiRobot/TransMVSNet .
研究动机与目标
- 为解决多视角立体匹配中局部特征表示的局限性,该局限性会妨碍在无纹理或重复区域中的鲁棒深度估计。
- 通过显式建模图像内部及跨图像之间的长距离全局上下文,提升多视角立体匹配中的特征匹配性能。
- 实现基于 Transformer 的多视角立体匹配网络的端到端训练,同时保证有效监督与低内存开销。
- 解决将 Transformer 适配到多视角立体匹配中“一对多”匹配特性所面临的挑战,该特性与标准图像匹配任务不同。
提出的方法
- 提出一种特征匹配 Transformer(FMT),利用视图内注意力聚合每个图像内的全局上下文,利用视图间注意力建模所有源图像之间的跨视图对应关系。
- 引入自适应感受野(ARF)模块,实现从局部聚合的 CNN 特征到全局感受野的 FMT 特征的平滑过渡,确保多尺度下的特征一致性。
- 采用转换特征路径,将中间特征与梯度在不同分辨率阶段间传递,实现高效的粗到细特征优化。
- 使用成对特征相关性计算参考图像与源图像特征图之间的匹配代价,提升对应关系估计的准确性。
- 应用模糊性减少的焦点损失,增强对难以预测像素的监督,尤其在模糊或具有挑战性的区域。
- 采用分阶段深度预测与渐进式深度假设优化的粗到细正则化策略。
实验结果
研究问题
- RQ1基于 Transformer 的架构能否有效建模多视角立体匹配中的长距离全局上下文,从而改善困难区域的深度估计?
- RQ2Transformer 的自注意力与交叉注意力机制如何适配多视角立体匹配中“一对多”的匹配特性,而非标准图像匹配任务?
- RQ3为实现高效且低内存开销的基于 Transformer 的多视角立体匹配网络端到端训练,需要哪些架构组件?
- RQ4通过 FMT 引入全局上下文是否能在标准多视角立体匹配基准上带来可测量的深度精度与完整性的提升?
主要发现
- 在 BlendedMVS 验证集上,TransMVSNet 的平均误差(EPE)为 0.73,显著优于先前方法,如 CasMVSNet(1.43 EPE)与 EPP-MVSNet(1.17 EPE)。
- 在 DTU 数据集上,TransMVSNet 的 EPE 为 0.73,相较于基线方法 CasMVSNet(1.43 EPE)实现了 48% 的相对性能提升,并在该基准上创下新的 SOTA 记录。
- 在 Tanks and Temples 基准上,TransMVSNet 达到最先进性能,展现出对复杂真实场景的强大泛化能力。
- 消融实验证实,Focal Loss、FMT、ARF 与转换特征路径等各组件均对性能有显著贡献,完整模型在 DTU 上的整体准确率达到 0.305。
- ARF 模块虽增加计算成本,但提升了特征适应能力;而转换路径在极低内存开销下显著提升了性能。
- 尽管推理速度相比基线模型慢 1.4 倍,完整模型每张图像的推理时间仍低于 1 秒,具备实际应用可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。