Skip to main content
QUICK REVIEW

[论文解读] SelFlow: Self-Supervised Learning of Optical Flow

Pengpeng Liu, Michael R. Lyu|arXiv (Cornell University)|Apr 19, 2019
Advanced Vision and Imaging参考文献 50被引用 14
一句话总结

SelFlow 提出了一种用于光流估计的自监督学习框架,通过从非遮挡像素中提炼可靠的光流预测,来指导在幻觉遮挡区域中的光流学习。通过在简单卷积神经网络中使用基于超像素的噪声注入和多帧时间建模,该方法在自监督设置下实现了最先进性能,并在经过监督微调后于 Sintel 基准测试中将 EPE 降低至 4.26,优于所有先前方法。

ABSTRACT

We present a self-supervised learning approach for optical flow. Our method distills reliable flow estimations from non-occluded pixels, and uses these predictions as ground truth to learn optical flow for hallucinated occlusions. We further design a simple CNN to utilize temporal information from multiple frames for better flow estimation. These two principles lead to an approach that yields the best performance for unsupervised optical flow learning on the challenging benchmarks including MPI Sintel, KITTI 2012 and 2015. More notably, our self-supervised pre-trained model provides an excellent initialization for supervised fine-tuning. Our fine-tuned models achieve state-of-the-art results on all three datasets. At the time of writing, we achieve EPE=4.26 on the Sintel benchmark, outperforming all submitted methods.

研究动机与目标

  • 解决在缺乏大规模标注数据的情况下,遮挡对光流估计带来的挑战。
  • 开发一种自监督方法,利用未标注的视频数据,学习适用于静态和动态场景的鲁棒光流。
  • 减少对合成预训练数据的依赖,并消除对特定数据集训练调度的需求。
  • 通过利用可靠的非遮挡区域光流预测来监督幻觉遮挡区域的学习,从而提升无监督光流估计性能。
  • 证明自监督预训练可作为监督微调的高效初始化,从而降低对合成预训练数据的依赖。

提出的方法

  • 该方法采用双分支网络结构:NOC-model 在光度损失下进行训练,用于估计非遮挡像素的光流;OCC-model 则学习遮挡区域的光流。
  • 通过扰动目标帧中随机选择的超像素,生成合成遮挡,以模拟新的遮挡情况。
  • 通过使用 NOC-model 在非遮挡像素上的预测结果,对 OCC-model 在新生成遮挡像素上的学习进行自监督。
  • 采用简单的卷积神经网络架构,聚合多帧时间信息,以提升光流估计的准确性。
  • 在训练过程中使用带有遮挡掩码的光度损失,以排除不可靠区域。
  • 通过随机超像素扰动实现知识蒸馏,生成多样化的遮挡模式,以实现鲁棒的自监督。

实验结果

研究问题

  • RQ1在无任何真实光流监督的情况下,自监督学习能否有效估计复杂自然遮挡下的光流?
  • RQ2能否利用非遮挡区域的可靠光流预测,通过自监督方式指导幻觉遮挡区域的学习?
  • RQ3在遮挡区域中,引入多帧时间信息是否能提升光流估计的准确性?
  • RQ4自监督预训练模型能否作为监督微调的有效初始化,从而减少对合成预训练数据的依赖?
  • RQ5与其它噪声注入策略相比,基于超像素的遮挡幻觉在性能和泛化能力方面表现如何?

主要发现

  • 所提方法在 Sintel 最终基准测试中实现 EPE=4.26,创下所有提交方法中的新最先进结果。
  • 在 KITTI 2012 上,无监督模型实现 EPE=1.69,相比之前最佳无监督方法 DDFlow 提升 28.1%。
  • 在 KITTI 2015 上,无监督模型实现 EPE=4.84,相比 DDFlow 提升 15.3%。
  • 经过监督微调后,模型在 KITTI 2012 上实现 Fl-all=6.19%,在 KITTI 2015 上实现 Fl-all=8.42%,优于所有先前的监督方法。
  • 消融实验证实,多帧输入和自监督显著提升性能,尤其在遮挡像素上,Sintel Clean 上的 EPE-OCC 从 26.63 降低至 22.06。
  • 自监督预训练可实现监督微调过程中的快速且稳定的收敛,即使在真实标注数据有限的情况下亦然。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。