Skip to main content
QUICK REVIEW

[论文解读] Weakly Supervised Energy-Based Learning for Action Segmentation

Jun Li, Peng Lei|arXiv (Cornell University)|Sep 28, 2019
Human Pose and Action Recognition参考文献 26被引用 9
一句话总结

本文提出了一种弱监督动作分割方法,采用一种新颖的受限判别性前向损失(CDFL),通过在分割图中区分有效与无效帧标注,提升训练效果。通过结合GRU-HMM架构并利用基于logadd的递归算法高效计算能量差异,CDFL在Breakfast、Hollywood Extended和50Salads数据集上实现了最先进性能,优于先前方法在动作分割与对齐任务中的表现。

ABSTRACT

This paper is about labeling video frames with action classes under weak supervision in training, where we have access to a temporal ordering of actions, but their start and end frames in training videos are unknown. Following prior work, we use an HMM grounded on a Gated Recurrent Unit (GRU) for frame labeling. Our key contribution is a new constrained discriminative forward loss (CDFL) that we use for training the HMM and GRU under weak supervision. While prior work typically estimates the loss on a single, inferred video segmentation, our CDFL discriminates between the energy of all valid and invalid frame labelings of a training video. A valid frame labeling satisfies the ground-truth temporal ordering of actions, whereas an invalid one violates the ground truth. We specify an efficient recursive algorithm for computing the CDFL in terms of the logadd function of the segmentation energy. Our evaluation on action segmentation and alignment gives superior results to those of the state of the art on the benchmark Breakfast Action, Hollywood Extended, and 50Salads datasets.

研究动机与目标

  • 为解决在仅有动作时间顺序而无帧级标注的弱监督设定下训练动作分割模型的挑战。
  • 克服先前方法依赖单一推断分割进行损失估计的局限性,此类方法在训练过程中易受模型不准确的影响而产生偏差。
  • 通过显式建模分割图中所有候选路径间有效与无效分割的判别边界,提升训练鲁棒性。
  • 开发一种基于logadd函数的递归算法,高效计算CDFL,支持具有指数级路径枚举的端到端训练。

提出的方法

  • 从初始HMM-GRU推理结果出发,通过受限Viterbi算法构建分割图,其中节点表示潜在的动作边界,边表示动作片段。
  • 在检测到的剪切点周围添加邻近帧,以优化边界检测并提升候选分割的多样性。
  • 将CDFL定义为所有有效路径(满足真实顺序)的累积能量与所有无效路径(违反真实顺序)的累积能量之差,以促进边界最大化。
  • 设计一种基于logadd函数的递归算法,高效计算分割图中指数级多条路径的总能量。
  • 使用CDFL端到端训练HMM与GRU,促使模型为无效分割分配更低能量,为有效分割分配更高能量。
  • 推理阶段,在学习到的模型上应用受限Viterbi解码,以生成分割图中的MAP路径,确保与训练阶段的时间一致性。

实验结果

研究问题

  • RQ1与依赖单一伪真实标签的损失函数相比,一种同时考虑所有有效与无效分割的损失函数是否能提升弱监督动作分割中的训练鲁棒性?
  • RQ2如何高效计算视频分割图中指数级候选分割的能量,以支持训练?
  • RQ3通过最大化有效分割与高分无效分割之间的边界,是否能提升动作分割与对齐任务的泛化能力?
  • RQ4在初始分割剪切点周围引入邻近帧在多大程度上能改善边界检测与整体性能?
  • RQ5与替代损失形式相比,所提出的CDFL损失在性能与训练稳定性方面表现如何?

主要发现

  • 在Breakfast数据集上,CDFL实现了最先进性能,Mof为63.0%,Mof-bg为61.4%,IoU为45.8%,IoD为63.9%,优于先前方法。
  • 在Hollywood Extended数据集上,CDFL实现64.3% Mof、70.8% Mof-bg、40.5% IoU与52.9% IoD,显著超越先前最先进方法。
  • 在50Salads数据集上,CDFL实现68.0% Mof、65.3% Mof-bg、45.5% IoU与58.7% IoD,展现出在多样化动作分布下的强大泛化能力。
  • 消融实验表明,使用$ L_{\text{CDF}} $且邻域窗口大小为6时,对齐性能最佳(Hollywood Extended上IoD为52.9%),证实了局部上下文的益处。
  • 基于logadd的递归CDFL计算方法实现了对指数级路径的高效训练,复杂度仅比先前方法略有增加。
  • 可视化结果表明,CDFL能生成准确的动作对齐结果,即使在复杂重叠序列中也能正确定位动作。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。