[论文解读] FusionNet and AugmentedFlowNet: Selective Proxy Ground Truth for Training on Unlabeled Images
本文提出FusionNet,一种通过学习评估网络融合多个光流估计结果以生成高质量代理真实值的方法,并提出AugmentedFlowNet,该网络在该代理真实值上进行微调,以实现无监督域自适应。该方法通过利用未标注的真实世界视频,显著提升了光流估计的准确性和鲁棒性,在KITTI基准上实现了最先进性能。
Recent work has shown that convolutional neural networks (CNNs) can be used to estimate optical flow with high quality and fast runtime. This makes them preferable for real-world applications. However, such networks require very large training datasets. Engineering the training data is difficult and/or laborious. This paper shows how to augment a network trained on an existing synthetic dataset with large amounts of additional unlabelled data. In particular, we introduce a selection mechanism to assemble from multiple estimates a joint optical flow field, which outperforms that of all input methods. The latter can be used as proxy-ground-truth to train a network on real-world data and to adapt it to specific domains of interest. Our experimental results show that the performance of networks improves considerably, both, in cross-domain and in domain-specific scenarios. As a consequence, we obtain state-of-the-art results on the KITTI benchmarks.
研究动机与目标
- 解决合成训练数据与真实世界图像之间在光流估计中的域差距问题。
- 在无需人工标注的情况下提升光流网络在真实世界数据上的性能。
- 仅使用未标注视频实现光流网络的域特定自适应。
- 开发一种代理真实值方法,其性能优于单一光流估计技术。
- 通过自监督自适应实现光流估计中准确率-推理速度权衡的最先进水平。
提出的方法
- FusionNet被训练以预测多个输入光流场的误差,从而在每个像素处选择误差最低的光流向量。
- FusionNet所选择的光流场作为高质量代理真实值,用于微调FlowNet。
- 由此得到的AugmentedFlowNet在大规模未标注视频数据上进行训练,实现在无人工标注情况下的域自适应。
- 该方法采用多阶段训练流程:首先在合成数据上训练FusionNet以评估光流质量;随后使用该代理真实值在真实图像上微调FlowNet。
- 评估网络采用损失函数,以最小化预测误差与合成数据集上真实误差之间的差异。
- 该方法支持跨域与域特定自适应,即使在未额外使用真实标签进行微调的情况下,性能仍可观提升。
实验结果
研究问题
- RQ1通过学习的光流方法集成能否生成超越任一单个方法性能的代理真实值?
- RQ2能否有效利用来自多个无监督光流估计器的代理真实值对FlowNet进行微调?
- RQ3在使用代理真实值对未标注真实世界视频进行训练后,是否能提升在KITTI等真实基准上的光流估计准确率?
- RQ4在域自适应性能方面,该方法与完全无监督或仅使用合成数据训练的基线方法相比表现如何?
- RQ5代理真实值方法是否具备跨域泛化能力,并在无真实标签访问的情况下实现最先进性能?
主要发现
- FusionNet优于所有单一输入方法,其生成的代理真实值在Sintel基准上实现了1.58的最终光流误差。
- 经过微调的增强型FlowNet(AugmentedFlowNetG-CSS)在KITTI 2012基准上达到2.10的最终光流误差,创下新SOTA纪录。
- 在KITTI真实标签上微调后,增强型FlowNet在KITTI 2015上实现2.17%的终点误差,超越此前SOTA结果。
- 仅在FusionNet代理上训练的通用版AugmentedFlowNet仍表现出色,优于基线FlowNet模型。
- 在FBMS上的运动分割结果表明,使用augmented FlowNetC可使F1分数提升4.77%,证明了真实世界自适应的优势。
- 堆叠式增强型FlowNet在某些情况下甚至优于FusionNet代理,尤其是在使用真实标签微调后,表明域特定自适应的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。