Skip to main content
QUICK REVIEW

[論文レビュー] D3TW: Discriminative Differentiable Dynamic Time Warping for Weakly Supervised Action Alignment and Segmentation

Chien-Yi Chang, De-An Huang|arXiv (Cornell University)|Jan 9, 2019
Human Pose and Action Recognition参考文献 41被引用数 10
ひとこと要約

本論文は、行動の順序のみを用いた弱教師付きアクションアライメントおよびセグメンテーションのための、判別的で微分可能な動的時間ワープ(D3TW)フレームワークを提案する。動的計画法におけるmin演算子の連続的リラクゼーションを導入することで、退化した1フレームへのアライメントを回避する微分可能な判別的損失を有するエンドツーエンド学習が可能となり、2つのベンチマークデータセットにおいて複数の指標で最先端の性能を達成した。

ABSTRACT

We address weakly supervised action alignment and segmentation in videos, where only the order of occurring actions is available during training. We propose Discriminative Differentiable Dynamic Time Warping (D3TW), the first discriminative model using weak ordering supervision. The key technical challenge for discriminative modeling with weak supervision is that the loss function of the ordering supervision is usually formulated using dynamic programming and is thus not differentiable. We address this challenge with a continuous relaxation of the min-operator in dynamic programming and extend the alignment loss to be differentiable. The proposed D3TW innovatively solves sequence alignment with discriminative modeling and end-to-end training, which substantially improves the performance in weakly supervised action alignment and segmentation tasks. We show that our model is able to bypass the degenerated sequence problem usually encountered in previous work and outperform the current state-of-the-art across three evaluation metrics in two challenging datasets.

研究の動機と目的

  • トレーニング時に行動の順序のみが利用可能な弱教師付きアクションアライメントおよびセグメンテーションの課題に対処すること。
  • 先行手法で一般的な退化したシーケンス問題(行動が誤って1フレームにマッピングされる現象)を克服すること。
  • 動的計画法に基づく損失関数の非微分性にもかかわらず、エンドツーエンド学習を可能にする微分可能な判別的損失関数の開発。
  • 行動の順序のみを用いた弱教師付き条件下で、アクションセグメンテーションおよびアライメントの両タスクの性能向上。
  • 弱教師付き構造的シーケンス予測において、連続的リラクゼーションを用いた判別的モデリングの有効性を示すこと。

提案手法

  • 動的計画法におけるmin演算子の連続的リラクゼーションを提案し、アライメント損失の微分可能性を実現。
  • 正しい(ポジティブ)トランスクリプトへのアライメントコストを最小化し、ネガティブなトランスクリプトへのコストを最大化する判別的損失を導入。
  • 微分可能なDTW定式化(D3TW)を用いて、勾配ベース最適化によるエンドツーエンド学習を可能に。
  • モデルが正しい行動順序とランダムなネガティブな順序を区別できるように、コントラスト学習戦略を採用。
  • 動的計画法フレームワーク内でのフレームレベルの監督情報をパス制約として統合することで、完全に弱教師付きおよび半教師付き設定をサポート。
  • 実世界の2つのデータセット(BreakfastおよびHollywood Extended)にフレームワークを適用し、アクションセグメンテーションおよびアライメントタスクの評価を実施。

実験結果

リサーチクエスチョン

  • RQ1判別的モデルに微分可能な損失関数を組み合わせることで、従来の代理損失に基づく手法を上回る弱教師付きアクションアライメントおよびセグメンテーション性能が達成可能か?
  • RQ2動的計画法におけるmin演算子の連続的リラクゼーションが、弱教師付き条件下での構造的シーケンス予測のエンドツーエンド学習を可能にするか?
  • RQ3提案手法が、先行研究で一般的な失敗モードである1フレームへのマッピングを伴う退化したアライメントを回避できるか?
  • RQ4判別的モデリングと微分可能な動的時間ワープの組み合わせが、アクションセグメンテーションおよびアライメントタスクの性能に与える影響は?
  • RQ5微分可能で判別的な定式化は、異なる弱教師付き動画理解ベンチマークにどの程度一般化可能か?

主な発見

  • D3TWは、2つの挑戦的なデータセット(BreakfastおよびHollywood Extended)において、アクションセグメンテーションおよびアライメントタスクの両方で最先端の性能を達成した。
  • Breakfastデータセットでは、57.0%のフレーム精度および56.3%のIoDを達成し、すべてのベースラインを上回った。
  • Hollywood Extendedデータセットでは、59.4%のフレーム精度および50.9%のIoDを達成し、新たなSOTAを樹立した。
  • アブレーションスタディの結果、判別的モデリングと微分可能なリラクゼーションの両方が不可欠であることが確認され、いずれかを除去すると性能が著しく低下した。
  • 半教師付き設定では、均一なベースラインおよびECTCよりも顕著に性能が向上し、ロバストネスと一般化性能を示した。
  • モデルは退化したシーケンス問題を効果的に回避し、過去の手法が直面する1フレームへのアライメントを防げた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。