[论文解读] Multi-Scale RAFT: Combining Hierarchical Concepts for Learning-based Optical FLow Estimation
本文提出多尺度 RAFT(MS-RAFT),一种新型光流网络,通过整合自粗到精的估计、U-Net 风格的多尺度特征、相关性金字塔以及多尺度多轮次损失,增强了单尺度 RAFT 框架。该方法在 MPI Sintel 和 KITTI 基准测试中取得了最先进性能,尤其在非遮挡区域表现更优,在 Sintel Final 上相比 RAFT 的准确率最高提升 14.6%,同时具备更高的鲁棒性和泛化能力。
Many classical and learning-based optical flow methods rely on hierarchical concepts to improve both accuracy and robustness. However, one of the currently most successful approaches -- RAFT -- hardly exploits such concepts. In this work, we show that multi-scale ideas are still valuable. More precisely, using RAFT as a baseline, we propose a novel multi-scale neural network that combines several hierarchical concepts within a single estimation framework. These concepts include (i) a partially shared coarse-to-fine architecture, (ii) multi-scale features, (iii) a hierarchical cost volume and (iv) a multi-scale multi-iteration loss. Experiments on MPI Sintel and KITTI clearly demonstrate the benefits of our approach. They show not only substantial improvements compared to RAFT, but also state-of-the-art results -- in particular in non-occluded regions. Code will be available at https://github.com/cv-stuttgart/MS_RAFT.
研究动机与目标
- 通过整合先前方法中的层次化概念,提升 RAFT 这一高度成功的单尺度光流网络的性能。
- 探究多尺度设计原则(此前在 PWC-Net 和 SpyNet 等方法中表现有效)在应用于 RAFT 架构时是否依然有益。
- 通过集成多尺度特征学习与损失监督,提升光流估计的准确率与鲁棒性,尤其在非遮挡区域。
- 通过引入样本级鲁棒化的多尺度多轮次损失,构建更稳健的训练目标。
提出的方法
- 提出一种共享的、部分共享的自粗到精架构,通过使用可学习的凸掩码进行上采样,实现从粗到精尺度的迭代优化。
- 采用 U-Net 风格的跳跃连接,整合编码器中的多尺度特征,实现在匹配过程中跨尺度的语义增强。
- 保留 RAFT 的相关性金字塔作为分层代价体积,以在每个尺度注入非局部代价信息,提升匹配精度。
- 提出一种多尺度多轮次损失,对所有尺度和迭代轮次施加监督,并引入样本级鲁棒化以提升训练稳定性和泛化能力。
- 在各尺度间共享循环更新单元,实现参数效率,同时保持高性能。
实验结果
研究问题
- RQ1当将多尺度设计原则(如自粗到精估计和多尺度特征)应用于单尺度 RAFT 框架时,是否仍能提升性能?
- RQ2结合层次化概念(自粗到精、多尺度特征、相关性金字塔、多尺度损失)对光流估计的准确率与鲁棒性有何影响?
- RQ3与单尺度监督相比,采用样本级鲁棒化的多尺度多轮次损失是否能带来更好的泛化能力并减少过拟合?
- RQ4所提出的各组件在具有挑战性的区域(如非遮挡区域)中,能将性能提升到何种程度?
主要发现
- 在 Sintel Final 基准测试中,MS-RAFT 相较于 RAFT 实现了 14.6% 的端点误差(EPE)相对提升,EPE 达到 1.37。
- 在 Sintel Clean 基准测试中,MS-RAFT 将 EPE 降低至 1.37,相比 RAFT 的 1.61 EPE 提升了 14.6%。
- 在非遮挡区域,MS-RAFT 达到了最先进性能,展现出更优的准确率与鲁棒性。
- 消融实验证实,自粗到精架构、多尺度特征与多尺度损失的组合至关重要——任一单一组件均无法带来显著提升。
- 采用样本级鲁棒化的多尺度多轮次损失可减少过拟合,提升泛化能力,在 Sintel Final 上相比单尺度损失的 EPE 改进达 43.6%。
- 性能最佳的配置采用 3 个尺度,并在相关性金字塔中设置 2 个查找层级,实现了准确率与计算成本之间的良好平衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。