Skip to main content
QUICK REVIEW

[论文解读] Learning by Analogy: Reliable Supervision from Transformations for Unsupervised Optical Flow Estimation

Liang Liu, Jiangning Zhang|arXiv (Cornell University)|Mar 29, 2020
Advanced Vision and Imaging参考文献 52被引用 11
一句话总结

该论文提出了一种新颖的无监督光流框架,通过使用变换输入和从原始数据的变换预测中获得的自监督监督,提升了训练的可靠性。通过将标准无监督流程扩展为在增强数据上增加一次前向传播,该方法在无监督方法中实现了最先进性能,并在参数更少的情况下实现了与有监督方法相当的结果,同时展现出强大的跨数据集泛化能力。

ABSTRACT

Unsupervised learning of optical flow, which leverages the supervision from view synthesis, has emerged as a promising alternative to supervised methods. However, the objective of unsupervised learning is likely to be unreliable in challenging scenes. In this work, we present a framework to use more reliable supervision from transformations. It simply twists the general unsupervised learning pipeline by running another forward pass with transformed data from augmentation, along with using transformed predictions of original data as the self-supervision signal. Besides, we further introduce a lightweight network with multiple frames by a highly-shared flow decoder. Our method consistently gets a leap of performance on several benchmarks with the best accuracy among deep unsupervised methods. Also, our method achieves competitive results to recent fully supervised methods while with much fewer parameters.

研究动机与目标

  • 解决在遮挡、低光照和过曝等挑战性场景下,无监督光流训练中光度损失不可靠的问题。
  • 克服无监督光流学习中知识蒸馏的局限性,包括冻结教师模型和多阶段训练的复杂性。
  • 实现在无需真实标签或复杂正则化的情况下,通过数据增强获得可靠监督的单网络训练。
  • 通过在无标签的真实世界视频数据(如CityScapes)上进行训练,实现跨数据集的优异泛化能力,而无需领域特定的微调。
  • 证明基于变换的自监督可普遍适用于多种增强类型,包括空间变换和AutoAugment策略。

提出的方法

  • 引入双前向传播机制:第一次在原始图像上进行前向传播以预测光流,第二次在增强(变换)后的图像上进行前向传播,利用第一次前向传播的变换预测生成自监督信号。
  • 将变换后的光流预测用作变换输入的可靠监督信号,避免在增强数据上标准无监督训练中出现的不可靠光度损失。
  • 设计一种轻量化、高度共享的光流解码器,支持多帧输入,从而在更长序列中实现高效且精确的估计。
  • 将多种数据增强技术——包括遮挡、低光照、过曝以及复杂的空间变换(如CPAB和AutoAugment)——集成到训练流程中。
  • 在整个网络上进行端到端的单阶段训练,消除了对独立教师-学生蒸馏或多阶段优化的需求。
  • 在空间变换前应用坐标校正(如随机缩放),以防止无效的光流坐标,确保数值稳定性。

实验结果

研究问题

  • RQ1基于变换的自监督是否能提升在光度一致性失效的挑战性场景中无监督光流训练的可靠性?
  • RQ2单网络框架能否在保持或提升性能的同时,替代需要冻结教师模型的多阶段知识蒸馏?
  • RQ3整合多样化的增强技术(如遮挡、曝光变化、空间扭曲)是否能提升无监督光流估计的泛化能力和鲁棒性?
  • RQ4使用该框架训练的轻量化多帧光流网络能否在显著减少参数量的情况下,实现与有监督模型相当的性能?
  • RQ5当在无标签的真实世界数据(如CityScapes)上进行训练时,该方法在未见数据集上的泛化能力如何?

主要发现

  • 所提方法在标准基准测试中,作为所有深度无监督光流方法中平均端点误差(AEPE)最低的模型,优于以往的无监督模型。
  • 在Sintel数据集上,该方法在干净集上达到3.50 AEPE,最终集上达到2.79 AEPE(最终)和3.73 AEPE(完整测试集),超越了以往的无监督方法。
  • 在KITTI 2012和KITTI 2015上,分别达到3.06和9.04 AEPE,展现出在真实世界场景中的强大性能。
  • 在未使用真实标签的CityScapes数据集上进行训练后,该模型在KITTI 2012上达到5.10 AEPE,在KITTI 2015上达到5.22 AEPE,优于许多在合成数据上训练的模型。
  • 在迁移到未见数据集时,其泛化能力优于有监督的PWC-Net,表明其具备更优的领域自适应能力。
  • 与AutoAugment和CPAB变换的结合进一步提升了精度,表明该框架与复杂增强策略具有良好的兼容性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。