Skip to main content
QUICK REVIEW

[论文解读] Online Adaptation through Meta-Learning for Stereo Depth Estimation

Zhenyu Zhang, Stéphane Lathuilière|arXiv (Cornell University)|Apr 17, 2019
Advanced Vision and Imaging参考文献 45被引用 13
一句话总结

该论文提出了一种名为在线元学习自适应(OMLA)的新方法,通过结合在线特征分布对齐与元学习,实现立体深度估计中的快速在线适应。该方法使深度网络仅需少量帧即可迅速适应新环境(如光照或地形变化),在KITTI基准测试中达到与在批量设置下训练的最先进模型相当的性能。

ABSTRACT

In this work, we tackle the problem of online adaptation for stereo depth estimation, that consists in continuously adapting a deep network to a target video recordedin an environment different from that of the source training set. To address this problem, we propose a novel Online Meta-Learning model with Adaption (OMLA). Our proposal is based on two main contributions. First, to reducethe domain-shift between source and target feature distributions we introduce an online feature alignment procedurederived from Batch Normalization. Second, we devise a meta-learning approach that exploits feature alignment forfaster convergence in an online learning setting. Additionally, we propose a meta-pre-training algorithm in order toobtain initial network weights on the source dataset whichfacilitate adaptation on future data streams. Experimentally, we show that both OMLA and meta-pre-training helpthe model to adapt faster to a new environment. Our proposal is evaluated on the wellestablished KITTI dataset,where we show that our online method is competitive withstate of the art algorithms trained in a batch setting.

研究动机与目标

  • 解决在动态环境中真实部署立体深度估计时的在线域自适应挑战。
  • 在仅使用极少标注数据的情况下,缓解源训练数据与未见目标视频序列之间的域偏移问题。
  • 开发一种元学习框架,实现在新视觉域序列适应过程中的快速收敛。
  • 通过引入一种优化初始网络权重的元预训练策略,提升模型泛化能力,以实现快速适应。
  • 证明在线自适应可达到与离线批量训练的最先进模型相当的性能。

提出的方法

  • 提出OMLA,一种结合使用批量归一化启发式统计的在线特征对齐与基于梯度的元优化的元学习框架,以实现快速适应。
  • 引入一种在线特征对齐过程,利用目标视频流的运行统计量,对齐源域与目标域的特征分布。
  • 设计一种元预训练损失,使用OMLA更新在源数据上训练网络,确保初始化有利于在新数据流上实现快速收敛。
  • 采用两阶段训练流程:首先在源数据集(如Synthia、SceneFlow Driving)上进行元预训练,然后在目标视频推理过程中应用OMLA。
  • 利用视频数据的序列特性,以增量方式更新网络权重,其中元学习的优化步骤可泛化于不同环境。
  • 在KITTI数据集上使用标准指标(如Abs Rel、Sq Rel、RMSE)进行训练与评估,以与离线基线模型进行性能对比。

实验结果

研究问题

  • RQ1深度立体深度模型是否能仅使用少量在线帧数据,快速适应新环境?
  • RQ2将特征对齐与元学习结合,是否能提升在线自适应中的收敛速度与最终准确率?
  • RQ3使用OMLA在源数据上进行元预训练,是否能为在线自适应提供比标准预训练更优的初始化?
  • RQ4在线自适应性能与在真实世界基准上离线批量训练的模型相比如何?
  • RQ5所提出方法是否能在不同网络架构和源数据集之间实现泛化?

主要发现

  • 与朴素在线学习相比,OMLA在视频序列的后期帧中显著提升了适应速度与最终性能。
  • 使用OMLA进行元预训练可实现更快收敛与更优性能,尤其在最后20%的帧中表现更佳,表明长期适应能力得到提升。
  • 完整OMLA模型在KITTI Eigen测试集上的表现优于朴素在线学习与离线基线模型,且在训练过程中从未接触过真实KITTI数据,仍取得了具有竞争力的结果。
  • 该方法在多种网络架构(包括轻量级模型如DispNet与MADNet)上均表现出色,证明了其泛化能力与鲁棒性。
  • 定性结果表明,OMLA的预测结果随时间推移逐步改善,仅在观察少量帧后即接近离线模型的质量。
  • 尽管由于额外的梯度计算导致推理速度约降低20%,但性能提升使得计算开销在真实世界部署中具有合理性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。