Skip to main content
QUICK REVIEW

[论文解读] D3TW: Discriminative Differentiable Dynamic Time Warping for Weakly Supervised Action Alignment and Segmentation

Chien-Yi Chang, De-An Huang|arXiv (Cornell University)|Jan 9, 2019
Human Pose and Action Recognition参考文献 41被引用 10
一句话总结

本文提出 D3TW,一种用于仅使用动作顺序监督的弱监督动作对齐与分割的判别式可微分动态时间规整框架。通过在动态规划中对最小值操作符进行连续松弛,D3TW 实现了可微分的判别式损失,避免了退化为单帧对齐的不良情况,实现了在两个基准数据集上的多个指标上的最先进性能。

ABSTRACT

We address weakly supervised action alignment and segmentation in videos, where only the order of occurring actions is available during training. We propose Discriminative Differentiable Dynamic Time Warping (D3TW), the first discriminative model using weak ordering supervision. The key technical challenge for discriminative modeling with weak supervision is that the loss function of the ordering supervision is usually formulated using dynamic programming and is thus not differentiable. We address this challenge with a continuous relaxation of the min-operator in dynamic programming and extend the alignment loss to be differentiable. The proposed D3TW innovatively solves sequence alignment with discriminative modeling and end-to-end training, which substantially improves the performance in weakly supervised action alignment and segmentation tasks. We show that our model is able to bypass the degenerated sequence problem usually encountered in previous work and outperform the current state-of-the-art across three evaluation metrics in two challenging datasets.

研究动机与目标

  • 解决在训练过程中仅提供动作顺序的弱监督动作对齐与分割挑战。
  • 克服先前方法中常见的退化序列问题,即动作被错误地对齐到单个帧上。
  • 开发一种可微分的判别式损失函数,即使基于动态规划的损失本身不可微,也能实现端到端训练。
  • 仅使用动作顺序监督,提升动作分割与对齐任务的性能。
  • 展示在弱监督下,结构化序列预测中使用连续松弛的判别建模的有效性。

提出的方法

  • 提出对动态规划中最小值操作符的连续松弛,使对齐损失可微分。
  • 引入一种判别式损失,最小化将视频对齐到正确(正样本)字幕的成本,同时最大化对负样本字幕的成本。
  • 采用可微分的 DTW 公式(D3TW),实现基于梯度优化的端到端训练。
  • 采用对比学习策略,使模型能够区分正确的动作顺序与随机生成的负样本。
  • 通过在动态规划框架中引入帧级监督作为路径约束,支持完全弱监督和半监督设置。
  • 将该框架应用于两个真实世界数据集:Breakfast 和 Hollywood Extended,并在动作分割与对齐任务上进行评估。

实验结果

研究问题

  • RQ1具有可微分损失函数的判别式模型是否能在弱监督动作对齐与分割任务中超越基于代理损失的方法?
  • RQ2动态规划中对最小值操作符的连续松弛是否能实现弱监督下结构化序列预测的端到端训练?
  • RQ3所提出的方法能否避免动作被映射到单个帧的退化对齐问题,这是先前工作中的常见失败模式?
  • RQ4判别式建模与可微分动态时间规整的结合对动作分割与对齐任务的性能有何影响?
  • RQ5该可微分且判别式的公式在不同弱监督视频理解基准上的泛化能力如何?

主要发现

  • D3TW 在两个具有挑战性的数据集 Breakfast 和 Hollywood Extended 上,于动作分割与对齐任务中均取得了最先进性能。
  • 在 Breakfast 数据集上,D3TW 实现了 57.0% 的帧准确率与 56.3% 的 IoD(对齐相似度),优于所有基线方法。
  • 在 Hollywood Extended 数据集上,D3TW 实现了 59.4% 的帧准确率与 50.9% 的 IoD,创下新的 SOTA 结果。
  • 消融实验表明,判别式建模与可微分松弛均至关重要,移除任一成分均导致性能显著下降。
  • 在半监督设置下,D3TW 显著优于均匀基线与 ECTC 方法,展现出强鲁棒性与泛化能力。
  • 该模型成功规避了退化序列问题,避免了先前方法中常见的单帧对齐现象。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。