Skip to main content
QUICK REVIEW

[论文解读] High Resolution Multi-Scale RAFT (Robust Vision Challenge 2022)

Azin Jahedi, Maximilian Luz|arXiv (Cornell University)|Oct 30, 2022
Advanced Vision and Imaging被引用 5
一句话总结

本文提出 MS-RAFT+,一种高分辨率、多尺度的光流估计方法,通过引入按需计算成本和额外的更细尺度,对 RAFT 进行改进,实现了无需预计算成本体积的全分辨率光流估计。该方法在 Robust Vision Challenge 2022 的所有基准测试中均获得第一名,包括在 VIPER、KITTI、Sintel 和 Middlebury 上的顶尖排名,展现出卓越的泛化能力和准确性。

ABSTRACT

In this report, we present our optical flow approach, MS-RAFT+, that won the Robust Vision Challenge 2022. It is based on the MS-RAFT method, which successfully integrates several multi-scale concepts into single-scale RAFT. Our approach extends this method by exploiting an additional finer scale for estimating the flow, which is made feasible by on-demand cost computation. This way, it can not only operate at half the original resolution, but also use MS-RAFT's shared convex upsampler to obtain full resolution flow. Moreover, our approach relies on an adjusted fine-tuning scheme during training. This in turn aims at improving the generalization across benchmarks. Among all participating methods in the Robust Vision Challenge, our approach ranks first on VIPER and second on KITTI, Sintel, and Middlebury, resulting in the first place of the overall ranking.

研究动机与目标

  • 在保持计算效率的同时,提升全分辨率下的光流估计精度。
  • 在不依赖任务特定微调的前提下,增强在多样化基准测试中的泛化能力。
  • 通过增加一个更细尺度,扩展 MS-RAFT 框架以提升细节保留能力。
  • 通过按需成本计算实现高分辨率光流估计,避免内存密集型的预计算。
  • 开发一种训练方案,以提升在多个数据集上的鲁棒性与性能。

提出的方法

  • 在自粗到细的估计流程中引入额外的更细尺度,扩展了 MS-RAFT 的四尺度框架。
  • 使用专用 CUDA 内核实现按需相关成本计算,避免存储所有配对成本体积。
  • 在所有尺度上使用共享的循环光流精炼和学习的凸上采样,包括全分辨率插值。
  • 采用改进的微调策略,结合样本级鲁棒损失与来自多个基准的混合训练数据。
  • 通过连续池化第二帧特征构建特征金字塔,实现在推理和训练期间的动态成本计算。
  • 通过使用学习的凸上采样,消除了全分辨率上采样中对双线性插值的依赖。

实验结果

研究问题

  • RQ1额外的更细尺度是否能在显著增加内存或计算量的前提下提升光流估计精度?
  • RQ2按需成本计算如何在避免预计算成本体积内存开销的同时,实现高分辨率光流估计?
  • RQ3混合训练策略在 KITTI、Sintel、Middlebury 和 VIPER 等多样化基准测试中,能在多大程度上提升泛化能力?
  • RQ4共享的循环精炼与上采样架构是否能在包括全分辨率在内的多个尺度上保持性能?
  • RQ5在具有挑战性的基准测试中,该方法与最先进方法相比,在鲁棒性与准确性方面表现如何?

主要发现

  • MS-RAFT+ 在 Robust Vision Challenge 2022 中获得整体排名第一,优于所有其他方法。
  • 在 VIPER 基准测试中,其在整体和所有类别(白天、日落、雨天、雪天、夜晚)中均位列第一,创下新的最先进水平。
  • 在 KITTI 2015 上,其整体排名第二,RVC 提交中排名第一(非遮挡区域),性能与 CamLiFlow++ 相当。
  • 在 Sintel 上,其在小位移情况下的干净序列和最终序列中均位列第一,RVC 排名中整体位列第二。
  • 在 Middlebury 上,其整体排名第二,RVC 方法中排名第二,尽管未使用 Middlebury 训练数据,表明其具有强大的泛化能力。
  • 该方法在 Sintel(干净)上的 EPE(终点误差)降低至 1.23,在 Sintel(最终)上为 2.68(采用冷启动初始化),相比冷启动有显著提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。