[论文解读] Object Discovery in Videos as Foreground Motion Clustering
该论文提出了一种新颖的方法,通过利用学习到的像素轨迹嵌入将视频中的物体发现问题建模为前景运动聚类。该方法引入了一种循环神经网络,以跨时间编码轨迹并进行聚类,从而实现一致的物体分割,在多个运动分割基准上取得了最先进性能,且无需后处理CRF层。
We consider the problem of providing dense segmentation masks for object discovery in videos. We formulate the object discovery problem as foreground motion clustering, where the goal is to cluster foreground pixels in videos into different objects. We introduce a novel pixel-trajectory recurrent neural network that learns feature embeddings of foreground pixel trajectories linked across time. By clustering the pixel trajectories using the learned feature embeddings, our method establishes correspondences between foreground object masks across video frames. To demonstrate the effectiveness of our framework for object discovery, we conduct experiments on commonly used datasets for motion segmentation, where we achieve state-of-the-art performance.
研究动机与目标
- 解决在无先验类别注释的情况下,从视频中发现未知物体的挑战。
- 通过联合利用外观和运动线索,区分移动的前景物体与静态背景。
- 通过轨迹聚类建立视频帧之间的一致物体对应关系。
- 学习用于像素轨迹的判别性特征嵌入,以实现鲁棒的基于运动的物体发现。
- 在标准运动分割数据集上,实现二值和多物体分割任务的最先进性能。
提出的方法
- 一种新颖的编码器-解码器网络,融合RGB帧和光流,以学习结合外观和运动线索的像素级特征嵌入。
- 一种自定义的循环神经网络(RNN)通过在前景掩码内的时间序列上聚合特征,学习像素轨迹的高层特征嵌入。
- 使用前景掩码作为注意力机制,聚焦于相关运动区域的轨迹聚类,从而提高分割精度。
- 使用聚类算法(例如k-means)对像素轨迹嵌入进行聚类,将每条轨迹分配给一个独立物体,实现在帧间的一致物体标注。
- 通过结合前景分割和轨迹嵌入学习的多任务损失函数,实现端到端训练。
- 最小化后处理——未使用CRF——展示了所学习表征的鲁棒性。
实验结果
研究问题
- RQ1通过学习到的嵌入引导,基于运动的像素轨迹聚类能否有效实现视频中未知物体的发现?
- RQ2如何通过深度学习整合运动和外观线索,以提升前景分割性能?
- RQ3循环网络能否有效学习用于基于运动的物体发现的判别性轨迹级表征?
- RQ4将前景掩码用作注意力机制是否能提升运动分割任务中的聚类性能?
- RQ5所提出方法在标准运动分割基准上相对于现有最先进方法的性能提升程度如何?
主要发现
- 该方法在FBMS、ComplexBackground和CamouflagedAnimal数据集上均达到最先进性能,相比第二名方法CCG,F-score相对提升了4.4%。
- 在DAVIS2016验证集上,模型在不使用CRF后处理的情况下,Jaccard度量达到71.4,优于LVO(70.1)及其他最先进方法。
- 该方法在各数据集上表现出高召回率,这对其F-score的提升贡献显著,尤其是在未见或具有挑战性的序列中。
- 在FT3D数据集上,模型在F-measure上相比MPNet相对提升了5.6%,表明其在合成数据上具有强大的泛化能力。
- 定性结果表明,由于预测前景掩码带来的注意力机制,该方法能正确分割光学流低或不一致的物体,而CCG则失败。
- 失败案例主要源于前景掩码预测不佳或聚类坍塌,即多个物体被合并为单一聚类。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。