[论文解读] Hybrid Learning of Optical Flow and Next Frame Prediction to Boost Optical Flow in the Wild
本文提出了一种混合学习框架,通过在具有真实光流的合成数据和使用自监督下一帧预测作为辅助任务的真实视频上联合训练,提升了真实世界视频中基于CNN的光流估计性能。该方法采用样本可变的多任务架构,在监督学习与自监督学习之间交替进行,实现了KITTI基准上的最先进性能,并在动作识别任务中取得显著提升,同时在无需对抗损失的情况下提高了下一帧预测的准确性。
CNN-based optical flow estimation has attracted attention recently, mainly due to its impressively high frame rates. These networks perform well on synthetic datasets, but they are still far behind the classical methods in real-world videos. This is because there is no ground truth optical flow for training these networks on real data. In this paper, we boost CNN-based optical flow estimation in real scenes with the help of the freely available self-supervised task of next-frame prediction. To this end, we train the network in a hybrid way, providing it with a mixture of synthetic and real videos. With the help of a sample-variant multi-tasking architecture, the network is trained on different tasks depending on the availability of ground-truth. We also experiment with the prediction of "next-flow" instead of estimation of the current flow, which is intuitively closer to the task of next-frame prediction and yields favorable results. We demonstrate the improvement in optical flow estimation on the real-world KITTI benchmark. Additionally, we test the optical flow indirectly in an action classification scenario. As a side product of this work, we report significant improvements over state-of-the-art in the task of next-frame prediction.
研究动机与目标
- 提升在真实世界视频中基于深度CNN的光流估计性能,其中真实光流数据稀缺。
- 利用自监督的下一帧预测作为辅助任务,以增强从无标注真实视频数据中学习特征的能力。
- 设计一种多任务架构,根据数据来源动态切换监督光流估计与自监督帧预测。
- 评估混合训练对下游任务(如动作识别)的影响,证明其在光流之外的可迁移性。
- 探究预测“下一帧光流”而非“下一帧图像”是否能因任务对齐更好而带来更优的光流质量。
提出的方法
- 使用合成视频(带真实光流)和真实视频(无真实光流)的混合数据,端到端训练一个多任务深度网络。
- 采用样本可变的多任务架构,通过一个“多路复用器”将输入路由至不同分支:在合成数据上进行光流估计,在真实数据上进行联合光流与帧预测。
- 网络在任务间共享特征编码器,任务特定的输出头分别为:2通道输出用于光流,3通道输出用于帧预测。
- 架构中额外包含两层转置卷积层,以生成全分辨率光流场,从而改善与帧预测任务的对齐。
- 训练在合成数据与真实数据周期之间交替进行,发现1:5的真实数据与合成数据周期比例为最优。
- 消融研究对比了标准下一帧预测与“下一帧光流”预测,其中网络预测当前帧与下一帧之间的光流。
实验结果
研究问题
- RQ1当与合成数据上的监督训练结合时,自监督的下一帧预测是否能提升真实世界视频中的光流估计性能?
- RQ2真实数据与合成数据训练周期的比例如何影响光流性能与泛化能力?
- RQ3与预测“下一帧”相比,预测“下一帧光流”是否因任务对齐更优而带来更好的光流质量?
- RQ4下一帧预测作为辅助任务,是否能提升动作识别等下游应用的性能?
- RQ5多任务训练是否必要,还是仅预训练后微调即可实现足够的迁移学习效果?
主要发现
- 在KITTI基准上,所提出的混合方法相较于基线FlowNet显著提升,平均端点误差(EPE)大幅降低。
- 在UCF101和HMDB51上的动作识别任务中,该方法分别相较基线FlowNet提升12.1%和9.8%的准确率。
- 将标准光流替换为“下一帧光流”预测,在动作识别中带来更大的性能增益,表明其与运动建模更契合。
- 该方法在仅使用L1损失的情况下,于UCF101上实现了最先进的下一帧预测性能,整体图像质量和鲁棒性优于对抗性方法。
- 网络对真实数据与合成数据的训练比例具有强鲁棒性,最优比例为1:5,偏离该比例时性能仅轻微下降。
- 在帧预测上进行预训练后微调,无法达到联合多任务训练的性能,证明端到端多任务优化的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。