Skip to main content
QUICK REVIEW

[论文解读] Instance Embedding Transfer to Unsupervised Video Object Segmentation

Siyang Li, Bryan Seybold|arXiv (Cornell University)|Jan 3, 2018
Visual Attention and Saliency Detection参考文献 35被引用 14
一句话总结

该论文提出了一种新颖的无监督视频实例分割方法,通过将预训练静态图像网络中的实例嵌入迁移至视频,利用物体性(objectness)和光流(optical flow)选择具有代表性的前景与背景嵌入。在无需任何微调的情况下,该方法在DAVIS数据集上达到78.5%的平均IoU,在FBMS上达到71.9%,证明了实例嵌入在视频帧之间的稳定性和可迁移性。

ABSTRACT

We propose a method for unsupervised video object segmentation by transferring the knowledge encapsulated in image-based instance embedding networks. The instance embedding network produces an embedding vector for each pixel that enables identifying all pixels belonging to the same object. Though trained on static images, the instance embeddings are stable over consecutive video frames, which allows us to link objects together over time. Thus, we adapt the instance networks trained on static images to video object segmentation and incorporate the embeddings with objectness and optical flow features, without model retraining or online fine-tuning. The proposed method outperforms state-of-the-art unsupervised segmentation methods in the DAVIS dataset and the FBMS dataset.

研究动机与目标

  • 解决无监督视频对象分割中的挑战,即前景对象在不同视频序列中发生变化(例如,一辆汽车在某一视频中为前景,在另一视频中为背景)。
  • 克服直接使用前景/背景分类网络在不同前景对象之间泛化能力差的问题,其原因在于领域偏移(domain shift)。
  • 利用在静态图像上预训练的实例嵌入网络进行视频分割,避免对视频特定标注或模型重训练的需求。
  • 开发一种非参数化、在线自适应的方法,通过物体性和运动显著性(motion saliency)选择前景和背景种子,实现在多样化视频内容中的鲁棒分割。

提出的方法

  • 该方法将预训练全卷积网络(FCN)中学习到的实例嵌入从静态图像迁移至视频,该网络联合学习语义类别与实例级嵌入。
  • 基于物体性分数和基于光流的运动显著性,选择具有代表性的前景与背景嵌入,构成每帧的种子集合。
  • 通过计算像素在嵌入空间中与前景或背景种子集合的最近邻,实现非参数化分割,无需学习新的分类器。
  • 通过每k帧更新一次前景与背景种子集合,实现在线自适应,提升对外观和运动变化的鲁棒性。
  • 该方法避免对嵌入网络进行模型微调或在线适应,仅依赖实例嵌入在时间上的稳定性。
  • 在半监督设置下,使用第一帧的真实掩码初始化种子集合,并通过密集条件随机场(dense CRF)进一步优化结果。

实验结果

研究问题

  • RQ1能否在不重新训练或微调的前提下,有效将预训练静态图像网络中的实例嵌入迁移至无监督视频对象分割?
  • RQ2实例嵌入在时间上的稳定性如何支持在前景对象变化的视频帧中实现一致的对象跟踪?
  • RQ3在缺乏监督的情况下,选择具有代表性的前景与背景嵌入的最有效标准是什么?
  • RQ4结合物体性和运动显著性与单独使用任一线索相比,如何提升种子选择质量与分割精度?
  • RQ5在长视频序列中,种子集合的在线自适应在多大程度上提升了性能?

主要发现

  • 该方法在DAVIS数据集上达到78.5%的平均交并比(IoU),在FBMS数据集上达到71.9%,优于所有先前的无监督方法,且无需任何微调。
  • 每k帧进行在线自适应显著提升性能,与非自适应初始化相比,逐帧自适应使IoU提升7.0%。
  • 结合物体性和运动显著性进行种子排序,可获得最高的初始前景种子准确率(94.6%)和最佳平均IoU(77.5%),优于单独使用任一线索。
  • 仅使用物体性时,初始种子准确率较低(88.2%),但最终IoU较高(75.7%),而仅使用运动显著性时,初始准确率为90.6%,IoU为74.3%,表明嵌入空间中的错误模式更具容错性。
  • 在半监督设置下,该方法在DAVIS验证集上达到77.6%的平均IoU,无需任何模型微调,优于包括OSVOS和SFL在内的多种先前方法。
  • 结果表明,实例嵌入在时间上具有稳定性,可作为视频分割的鲁棒外观模型,即使同一对象在不同序列中作为前景或背景出现亦能保持有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。