[论文解读] Learning Optical Flow via Dilated Networks and Occlusion Reasoning
本文提出了一种使用空洞卷积和遮挡推理的无监督光流估计方法,以改善多尺度处理并减少网格化伪影。通过用空洞卷积替代转置卷积,并引入密集跳跃连接,该模型保留了高分辨率特征,在KITTI基准上实现了最先进性能,F1-all误差为2.35%,动作识别准确率为82.5%。
Despite the significant progress that has been made on estimating optical flow recently, most estimation methods, including classical and deep learning approaches, still have difficulty with multi-scale estimation, real-time computation, and/or occlusion reasoning. In this paper, we introduce dilated convolution and occlusion reasoning into unsupervised optical flow estimation to address these issues. The dilated convolution allows our network to avoid upsampling via deconvolution and the resulting gridding artifacts. Dilated convolution also results in a smaller memory footprint which speeds up interference. The occlusion reasoning prevents our network from learning incorrect deformations due to occluded image regions during training. Our proposed method outperforms state-of-the-art unsupervised approaches on the KITTI benchmark. We also demonstrate its generalization capability by applying it to action recognition in video.
研究动机与目标
- 解决无监督光流估计中的局限性,包括多尺度处理、网格化伪影和遮挡推理。
- 减少对转置卷积的依赖,以避免分辨率损失和网格化伪影,同时保持高分辨率特征图。
- 通过显式建模遮挡区域,利用前向-后向一致性,提升训练稳定性和准确性。
- 在无需真实光流监督的情况下,增强模型在下游任务(如动作识别)中的泛化能力。
- 在保持高精度的同时,实现实时推理速度,适用于真实世界基准测试。
提出的方法
- 在最后几层用空洞卷积替代转置卷积上采样,以保留空间分辨率并避免网格化伪影。
- 在后续卷积块(conv3_1、conv4_1、conv5_1)中使用空洞卷积,膨胀率分别为2和4,以在不下采样的情况下扩展感受野。
- 在各层之间集成密集跳跃连接,以改善特征传播并捕捉细微运动,尤其适用于小物体。
- 采用基于图像光度一致性和亮度恒定性的无监督训练目标,仅在非遮挡区域反向传播梯度。
- 通过前向-后向光流一致性实现遮挡推理:仅在前向与后向光流一致的区域更新梯度。
- 端到端训练,使用图像重建损失,无需真实光流监督。
实验结果
研究问题
- RQ1空洞卷积是否能在不使用转置卷积上采样的情况下,提升多尺度光流估计性能?
- RQ2通过前向-后向一致性实现的遮挡推理在无监督光流估计中起到何种改善作用?
- RQ3通过空洞卷积和密集连接保留高分辨率特征,在多大程度上提升了光流估计的准确性?
- RQ4一种未使用真实光流监督训练的无监督光流模型,能否在下游任务(如动作识别)中实现强泛化能力?
- RQ5所提方法是否在真实世界基准(如KITTI 2012和2015)上优于现有无监督基线方法?
主要发现
- 所提方法在KITTI 2015基准上实现了2.35%的F1-all误差,优于最先进无监督方法。
- 在KITTI 2012上,模型报告1.56%的F1-all误差,显著优于先前无监督方法。
- 在UCF101动作识别基准上,模型达到82.5%的top-1准确率,尽管为无监督训练,仍超越FlowNet2和FlowFields。
- 模型推理速度达33.3 fps,支持实时推理,优于FlowNet2(8 fps)和FlowFields(0.06 fps)。
- 与基于转置卷积的方法相比,空洞卷积的使用降低了内存占用并消除了网格化伪影。
- 遮挡推理的引入使遮挡区域和非遮挡区域的误差率均降低50%以上,相比无遮挡感知的模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。