[论文解读] Unsupervised Action Segmentation for Instructional Videos
该论文提出了一种无监督方法,用于在教学视频中进行原子动作分割,采用带有Gumbel-Softmax采样的随机循环自回归模型,生成多个候选动作序列。通过自定义约束条件——动作出现次数、持续时间一致性以及视觉合理性——对这些序列进行排序,模型迭代地自我标注视频,并在无需任何真实标注的情况下收敛到准确的分割结果,在基准数据集上的表现优于以往的无监督方法,甚至超过部分弱监督方法。
In this paper we address the problem of automatically discovering atomic actions in unsupervised manner from instructional videos, which are rarely annotated with atomic actions. We present an unsupervised approach to learn atomic actions of structured human tasks from a variety of instructional videos based on a sequential stochastic autoregressive model for temporal segmentation of videos. This learns to represent and discover the sequential relationship between different atomic actions of the task, and which provides automatic and unsupervised self-labeling.
研究动机与目标
- 在没有任何人工标注的动作边界或标签的情况下,从教学视频中发现原子动作。
- 建模复杂任务的时间结构,其中动作遵循可预测但顺序可变的序列。
- 开发一种自我监督机制,利用视频级约束条件生成并排序合理的动作序列。
- 通过迭代优化的自我标注EM类过程,实现端到端的无监督学习。
- 仅使用视频输入,在标准基准上超越现有无监督和弱监督方法。
提出的方法
- 一种带有状态、输出符号和概率转移规则的序列随机自回归模型,通过全连接层实现,并利用Gumbel-Softmax进行随机采样。
- 输入视频帧通过卷积神经网络(如VGG或AssembleNet)编码为特征序列,再通过自回归方式处理以生成动作序列。
- 通过Gumbel-Softmax对不同规则进行采样,每段视频生成多个候选动作序列,从而在不同运行中引入随机性。
- 一个排序函数基于三项约束评估序列:(1) 每个动作至少出现一次;(2) 同一任务的视频中动作持续时间保持一致;(3) 动作符号与视觉特征匹配。
- 将得分最高的序列用作伪标签来训练模型,整个过程以类似EM的迭代优化循环进行。
- 通过可微分损失函数联合优化排序函数的各个组成部分,实现基于梯度的端到端训练。
实验结果
研究问题
- RQ1随机自回归模型能否从非结构化的教学视频中学习生成多个合理的动作序列?
- RQ2在缺乏标注的情况下,基于结构约束(如动作出现次数、持续时间一致性)的自我标注策略有多有效?
- RQ3无监督动作分割的性能在多大程度上可以达到甚至超越弱监督和监督基线?
- RQ4该方法对作为超参数指定的动作数量(k)的敏感度如何?
- RQ5与确定性或随机选择相比,使用Gumbel-Softmax采样是否显著提升了自我标注的质量?
主要发现
- 所提出的无监督方法在50-Salads、Breakfast和NIV数据集上均达到最先进性能,优于以往的无监督方法,甚至超过部分弱监督方法。
- 在NIV数据集上,使用AssembleNet特征时,该方法取得了0.457的F1分数,超过先前方法(如Alayrac等人[1]的0.238,Kukleva等人[8]的0.283)。
- 消融实验证明,损失函数的三个组成部分——动作出现次数、持续时间一致性以及视觉合理性——均显著提升了性能,三者结合时在50-Salads上达到33.4的F1,在Breakfast上达到29.8。
- 若采用候选序列的随机选择或禁用Gumbel-Softmax,则性能显著下降(50-Salads上F1分别为12.5和10.5),证实了随机采样对有效自我标注的必要性。
- 该模型对k(动作数量)的选择具有相对鲁棒性,性能在接近真实动作数时达到峰值,如图5所示。
- 即使使用VGG特征而非AssembleNet,仍取得良好结果,NIV数据集上F1达到0.376,表明该方法在不同特征提取器间具有良好的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。