[论文解读] Make One-Shot Video Object Segmentation Efficient Again
本文提出 e-OSVOS,一种高度高效的少样本视频实例分割方法,通过元学习模型初始化和神经元级学习率,大幅减少推理时微调迭代次数,同时实现最先进性能。通过直接微调带目标检测头的 Mask R-CNN 并应用在线自适应机制,e-OSVOS 仅需 50–100 次推理时迭代即可实现高精度,优于 DAVIS 2016、DAVIS 2017 和 YouTube-VOS 上的先前微调方法,推理速度高出数个数量级。
Video object segmentation (VOS) describes the task of segmenting a set of objects in each frame of a video. In the semi-supervised setting, the first mask of each object is provided at test time. Following the one-shot principle, fine-tuning VOS methods train a segmentation model separately on each given object mask. However, recently the VOS community has deemed such a test time optimization and its impact on the test runtime as unfeasible. To mitigate the inefficiencies of previous fine-tuning approaches, we present efficient One-Shot Video Object Segmentation (e-OSVOS). In contrast to most VOS approaches, e-OSVOS decouples the object detection task and predicts only local segmentation masks by applying a modified version of Mask R-CNN. The one-shot test runtime and performance are optimized without a laborious and handcrafted hyperparameter search. To this end, we meta learn the model initialization and learning rates for the test time optimization. To achieve optimal learning behavior, we predict individual learning rates at a neuron level. Furthermore, we apply an online adaptation to address the common performance degradation throughout a sequence by continuously fine-tuning the model on previous mask predictions supported by a frame-to-frame bounding box propagation. e-OSVOS provides state-of-the-art results on DAVIS 2016, DAVIS 2017, and YouTube-VOS for one-shot fine-tuning methods while reducing the test runtime substantially. Code is available at https://github.com/dvl-tum/e-osvos.
研究动机与目标
- 为解决现有少样本微调方法在视频实例分割(VOS)中效率低下的问题,这些方法通常需要数百至数千次推理时迭代。
- 通过元学习自动学习最优初始化和学习率,克服基于微调的 VOS 中固定预训练和手工设计超参数的局限性。
- 在不依赖模板匹配或掩码传播的前提下,实现高效且高性能的少样本 VOS,恢复微调作为核心范式的技术可行性。
- 通过引入在线自适应机制,持续利用帧间边界框传播对过去预测结果进行微调,提升长序列上的鲁棒性。
- 证明微调可以兼具高效与有效,挑战近期放弃微调、转向非学习方法的趋势。
提出的方法
- 通过元学习获得最优初始模型权重,使其适用于任意对象的后续少样本微调,从而消除对固定预训练的依赖。
- 在神经元层面预测学习率,实现在推理时微调过程中的自适应、任务特定优化,避免手动调参。
- 通过使用 Mask R-CNN 的端到端可训练检测头,将目标检测与分割解耦,将掩码预测限制在局部区域,降低计算成本。
- 通过每五帧微调一次模型的方式应用在线自适应,利用先前预测的掩码和传播的边界框,缓解性能随时间退化的问题。
- 在 Mask R-CNN 中使用 RoIAlign 提取局部区域特征,提升定位精度,同时将分割范围限制在相关物体区域。
- 在元学习框架中训练模型,使初始化和学习率自适应机制在多样化对象和视频上进行优化,以泛化至各类推理场景。
实验结果
研究问题
- RQ1少样本微调能否被优化到足够高效,从而在不牺牲性能的前提下实现实时视频实例分割?
- RQ2元学习能否用于自动发现适用于 VOS 推理时微调的最优模型初始化和学习率调度?
- RQ3与固定或参数级学习率相比,预测每个神经元的学习率是否能带来更好的泛化能力和更快收敛?
- RQ4在仅引入极低推理开销的前提下,端到端的 Mask R-CNN 搭载检测头能否在少样本 VOS 中超越专用掩码提议或传播方法?
- RQ5在线自适应能否在不依赖大量重训练或额外模块的前提下,稳定长视频序列上的性能表现?
主要发现
- e-OSVOS 在 DAVIS 2016、DAVIS 2017 和 YouTube-VOS 上的少样本微调方法中达到最先进性能,尽管迭代次数显著更少,仍超越 PReMVOS 在多个序列上的表现。
- e-OSVOS-100-OnA 变体在 DAVIS 2017 上实现 88.1% 的平均 IoU,平均性能优于 PReMVOS(88.8%),且推理速度达 0.29 帧/秒,远超 PReMVOS 的 0.01 帧/秒。
- 仅使用 50 次推理时迭代的 e-OSVOS-50-OnA 在 DAVIS 2017 上实现 86.5% 的平均 IoU,证明高精度可在极低计算量下实现。
- 与先前微调方法相比,e-OSVOS 将推理时计算成本降低数个数量级,后者每对象需多达 1000 次迭代。
- 尽管架构更简单,e-OSVOS 在 blackswan 和 india 等挑战性序列上仍表现优异,这些序列对边界预测精度要求极高。
- 消融实验证实,元学习初始化和神经元级学习率对性能至关重要,若移除这些组件,精度显著下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。