Skip to main content
QUICK REVIEW

[论文解读] AutoFlow: Learning a Better Training Set for Optical Flow

Deqing Sun, Daniel Vlasic|arXiv (Cornell University)|Apr 29, 2021
Advanced Vision and Imaging参考文献 51被引用 4
一句话总结

AutoFlow 提出了一种可学习的、基于2D分层的合成数据生成方法,用于光学流预训练,通过优化渲染超参数以最大化在目标数据集上的模型性能。通过使用简单的2D运动与形状参数化并结合可微训练,AutoFlow 实现了最先进性能——仅用4个增强后的样本微调 RAFT,其性能即优于使用22,872个 FlyingChairs 样本进行训练的结果。

ABSTRACT

Synthetic datasets play a critical role in pre-training CNN models for optical flow, but they are painstaking to generate and hard to adapt to new applications. To automate the process, we present AutoFlow, a simple and effective method to render training data for optical flow that optimizes the performance of a model on a target dataset. AutoFlow takes a layered approach to render synthetic data, where the motion, shape, and appearance of each layer are controlled by learnable hyperparameters. Experimental results show that AutoFlow achieves state-of-the-art accuracy in pre-training both PWC-Net and RAFT. Our code and data are available at https://autoflow-google.github.io .

研究动机与目标

  • 为解决合成光学流数据集缺乏系统化设计的问题,而这类数据集对深度网络的预训练至关重要。
  • 探究更简单的可学习渲染流水线是否能超越复杂的基于3D的合成数据集(如 FlyingChairs 和 FlyingThings3D)。
  • 确定哪些数据特征(如运动统计、物体数量或数据增强方式)对模型泛化能力和准确率影响最大。
  • 探索是否直接在目标数据集上优化预训练数据分布,能带来比使用静态、人工设计数据集更好的下游性能。

提出的方法

  • AutoFlow 使用基于2D分层的渲染流水线,每一层均具有可学习的超参数,用于控制运动、形状和外观。
  • 渲染过程具备可微性,支持通过梯度下降端到端优化超参数,以最小化在目标数据集上的模型误差。
  • 该方法联合优化合成数据生成与模型训练过程,以目标数据集的性能作为目标函数。
  • 超参数包括前景物体数量、运动模型(采用双线性网格变形)、以及形状与外观的渲染参数。
  • 训练期间应用数据增强(如 RandAugment),以提升多样性并改善泛化能力。
  • 评估方式为:在 AutoFlow 生成的数据上预训练 PWC-Net 和 RAFT 等模型,并在 Sintel 和 KITTI 基准上测量其性能。

实验结果

研究问题

  • RQ1一个具有可学习超参数的简单2D分层渲染流水线,是否能在光学流模型的预训练中超越复杂的基于3D的合成数据集(如 FlyingChairs)?
  • RQ2哪些具体的数据特征(如运动幅度分布、物体数量、增强类型)对实现高模型准确率最为关键?
  • RQ3在目标数据集上直接优化预训练数据分布,是否能带来比使用固定、人工设计数据集更好的泛化性能?
  • RQ4使用 AutoFlow 生成的数据时,最少需要多少训练样本,才能达到与大规模合成数据集相当的性能?
  • RQ5尽管 AutoFlow 的运动统计与真实数据集(如 Sintel)存在显著差异,为何其仍表现优异?

主要发现

  • 仅用4个增强后的 AutoFlow 样本微调 RAFT,其在 Sintel.final 上的 AEPE 为 3.57,与使用 22,872 个 FlyingChairs 样本并进行增强训练的结果持平(3.57 vs. 3.57),而最终模型的 AEPE 为 2.57,优于 FlyingChairs 上的 3.76。
  • 使用 AutoFlow 进行预训练,可将 PWC-Net 在 Sintel.final 上的 AEPE 从 4.42(FlyingChairs)降低至 2.91,使其性能与在 FlyingChairs 上预训练的 RAFT 相当。
  • 当 PWC-Net 和 RAFT 均在足够多的 AutoFlow 数据上进行预训练时,两者之间的性能差距显著缩小,表明 AutoFlow 能更有效地支持简单模型的学习。
  • AutoFlow 的运动统计与 Sintel 和 FlyingChairs 不同——其集中在中高运动范围,且小运动被显著低估,这可能是因为微小运动对整体误差指标贡献较小。
  • 关闭颜色增强后,KITTI 上的性能出现严重下降(AEPE 从 4.66 上升至 14.06),凸显了光照变化在真实世界泛化中的关键作用。
  • 该方法泛化能力良好:在 Sintel.final 或 KITTI 上学习的超参数在两者上均表现相似,表明渲染流水线起到了正则化作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。