Skip to main content
QUICK REVIEW

[論文レビュー] Weakly Supervised Energy-Based Learning for Action Segmentation

Jun Li, Peng Lei|arXiv (Cornell University)|Sep 28, 2019
Human Pose and Action Recognition参考文献 26被引用数 9
ひとこと要約

本稿では、分類グラフ内の有効なフレームラベル付けと無効なフレームラベル付けを区別することで、学習を改善する、新たな制約付き判別的フォワード損失(CDFL)を用いた弱教師あり行動分離手法を提案する。GRU-HMMアーキテクチャを活用し、再帰的なlogaddベースのアルゴリズムによりエネルギー差を効率的に計算することで、CDFLはBreakfast、Hollywood Extended、50Saladsデータセットにおいて最先端の性能を達成し、行動分離およびアライメントの両タスクで先行手法を上回った。

ABSTRACT

This paper is about labeling video frames with action classes under weak supervision in training, where we have access to a temporal ordering of actions, but their start and end frames in training videos are unknown. Following prior work, we use an HMM grounded on a Gated Recurrent Unit (GRU) for frame labeling. Our key contribution is a new constrained discriminative forward loss (CDFL) that we use for training the HMM and GRU under weak supervision. While prior work typically estimates the loss on a single, inferred video segmentation, our CDFL discriminates between the energy of all valid and invalid frame labelings of a training video. A valid frame labeling satisfies the ground-truth temporal ordering of actions, whereas an invalid one violates the ground truth. We specify an efficient recursive algorithm for computing the CDFL in terms of the logadd function of the segmentation energy. Our evaluation on action segmentation and alignment gives superior results to those of the state of the art on the benchmark Breakfast Action, Hollywood Extended, and 50Salads datasets.

研究の動機と目的

  • フレームレベルのアノテーションがなく、行動の時間的順序のみが入手可能な弱教師あり設定において、行動分離モデルを訓練する課題に対処すること。
  • 訓練中にモデルの不正確さが原因でバイアスが生じる可能性がある単一の推定分離結果に依存する先行手法の限界を克服すること。
  • 分類グラフ内のすべての候補パスにおいて、有効な分離と無効な分離の間の判別マージンを明示的にモデル化することで、学習のロバスト性を向上させること。
  • 指数的多数のパスのエネルギー合計を効率的に計算する再帰的アルゴリズムを考案し、指数的パス数の列挙に対応したエンドツーエンド学習を可能とすること。

提案手法

  • 制約付きビタビ法を用いて初期のHMM-GRU推論から分類グラフを構築し、ノードは潜在的な行動境界を表し、エッジは行動セグメントを表す。
  • 検出されたカットの周辺フレームを追加することでグラフを拡張し、境界検出の精度を向上させるとともに、候補分離の多様性を高める。
  • CDFLを、正解の順序を満たすすべての有効パスの蓄積エネルギーと、それを違反するすべての無効パスの蓄積エネルギーとの差分として定義し、マージン最大化を促進する。
  • logadd関数に基づく再帰的アルゴリズムを開発し、分類グラフ内の指数的多数のパスの総エネルギーを効率的に計算する。
  • HMMとGRUをCDFLを用いてエンドツーエンドで学習させ、無効な分離に対しては低いエネルギー、有効な分離に対しては高いエネルギーを割り当てるようモデルを促進する。
  • 推論時、学習済みモデルに対して制約付きビタビデコードを適用し、時間的整合性を保ったMAPパスを生成する。

実験結果

リサーチクエスチョン

  • RQ1すべての有効および無効な分離を考慮する損失関数は、単一の擬似正例に依存する手法と比較して、弱教師あり行動分離における学習のロバスト性を向上させるか?
  • RQ2動画の分類グラフにおける指数的多数の候補分離のエネルギーを、学習に効率的に計算するにはどうすればよいか?
  • RQ3有効な分離とスコアの高い無効な分離の間のマージンを最大化することは、行動分離およびアライメントタスクにおける一般化性能の向上に寄与するか?
  • RQ4初期の分離カットの周囲に近接フレームを組み込むことで、境界検出および全体的な性能はどの程度向上するか?
  • RQ5他の損失形式と比較して、提案されたCDFL損失は性能および学習安定性の面で優れているか?

主な発見

  • Breakfastデータセットでは、CDFLが63.0% Mof、61.4% Mof-bg、45.8% IoU、63.9% IoDを達成し、先行手法を上回った。
  • Hollywood Extendedデータセットでは、CDFLが64.3% Mof、70.8% Mof-bg、40.5% IoU、52.9% IoDを達成し、前回の最先端を著しく上回った。
  • 50Saladsデータセットでは、CDFLが68.0% Mof、65.3% Mof-bg、45.5% IoU、58.7% IoDを達成し、多様な行動分布にわたる強力な一般化性能を示した。
  • アブレーションスタディの結果、隣接窓サイズ6を用いた$ L_{\text{CDF}} $が、Hollywood Extendedで52.9% IoDという最高のアライメント性能を達成し、局所的文脈の有効性を裏付けた。
  • 再帰的logaddベースのCDFL計算により、指数的多数のパスを効率的に扱える学習が可能となり、先行手法と比較して計算量の増加はわずかであった。
  • 可視化結果から、CDFLは正確な行動アライメントを生成し、複雑で重複するシーケンスでさえも正しく行動を局所化できていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。