[论文解读] Unsupervised Learning and Segmentation of Complex Activities from Video
本文提出一种无监督方法,通过迭代的判别-生成框架,将长视频中的复杂活动分割为连贯的子活动。该方法结合判别性视觉特征嵌入与广义马尔可夫模型(GMM),以捕捉灵活的时间顺序,且在无需文本输入的情况下,在Breakfast和Inria Instructional Videos数据集上优于最先进(SOTA)的无监督与弱监督方法。
This paper presents a new method for unsupervised segmentation of complex activities from video into multiple steps, or sub-activities, without any textual input. We propose an iterative discriminative-generative approach which alternates between discriminatively learning the appearance of sub-activities from the videos' visual features to sub-activity labels and generatively modelling the temporal structure of sub-activities using a Generalized Mallows Model. In addition, we introduce a model for background to account for frames unrelated to the actual activities. Our approach is validated on the challenging Breakfast Actions and Inria Instructional Videos datasets and outperforms both unsupervised and weakly-supervised state of the art.
研究动机与目标
- 解决在无任何文本监督的情况下,对长视频序列中复杂、程序性活动进行无监督分割的挑战。
- 建模子活动的灵活时间顺序,包括缺失步骤和偏差,这些在真实世界教学视频中很常见。
- 通过迭代优化过程,联合学习子活动的视觉外观表征及其时间结构。
- 考虑与主要活动无关的背景帧,以提高分割精度。
- 在无监督活动分割任务中实现最先进性能,超越无监督与弱监督基线方法。
提出的方法
- 采用判别性方法,通过排名损失学习从视觉特征到低维嵌入空间的线性映射,以聚类相似子活动并分离不同子活动。
- 采用广义马尔可夫模型(GMM)对子活动排列的分布进行建模,强制执行规范顺序,同时允许在现实世界变化中保持灵活性。
- 引入背景模型以识别并排除不属于任何子活动的帧,从而提高分割保真度。
- 在迭代的EM-like框架中交替优化视觉表征与时间结构,通过多轮迭代优化两个组件。
- 采用概率推理方案,基于学习到的参数与观测特征,为帧级别分配标签(子活动或背景)。
- 应用具有超参数ρ₀的先验,以控制GMM的灵活性,平衡规范顺序与偏差容忍度。
实验结果
研究问题
- RQ1我们能否仅使用视觉输入,在无任何文本或时间监督的情况下,实现复杂视频活动的最先进无监督分割?
- RQ2如何建模子活动的时间结构,以支持缺失步骤、动作重排和灵活顺序?
- RQ3在长且未修剪的视频序列中,引入背景模型在多大程度上能提升分割性能?
- RQ4与马尔可夫或RNN-based方法相比,基于GMM的时间建模在捕捉全局顺序约束方面表现如何?
- RQ5为何在具有重复子活动的活动中性能会下降?该模型能否扩展以处理此类情况?
主要发现
- 在Breakfast Actions数据集上,该方法取得0.471的F1分数,优于所有无监督与弱监督基线方法,包括基于RNN与判别性聚类的方法。
- 在Inria Instructional Videos数据集上,该方法取得47.1%的Jaccard指数与34.6%的Mof,达到或超过无监督设置下的最先进结果。
- 在'perform CPR'与'changing tire'任务中性能下降,原因在于重复的子活动,而单模态GMM无法有效建模此类重复,表明该方法在处理重复性方面存在局限。
- 当ρ₀ = 5时,模型在'changing tire'任务上取得与[1]相当的性能(F1 = 0.41),表明调整先验可提升严格顺序任务的性能。
- 在五项活动中的三项,该方法持续优于[1],证明灵活顺序建模相比刚性序列约束具有优势。
- 背景模型能有效识别非活动帧,各类活动的背景帧比例在0.46至0.83之间,显著提升了分割的一致性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。