Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Learning and Segmentation of Complex Activities from Video

Fadime Şener, Angela Yao|arXiv (Cornell University)|Mar 26, 2018
Human Pose and Action Recognition参考文献 23被引用数 11
ひとこと要約

本稿では、反復的で識別的・生成的フレームワークを用いて、視覚的特徴埋め込みと一般化マリウス分布(GMM)を組み合わせることで、テキスト入力に依存せずに、長時間の動画における複雑なアクティビティを一貫性のある部分アクティビティに無教師で分割する手法を提案する。本手法は、テキスト入力なしで、BreakfastおよびInria Instructional Videosデータセットにおいて、最先端の無教師および弱教師あり手法を上回る性能を達成する。

ABSTRACT

This paper presents a new method for unsupervised segmentation of complex activities from video into multiple steps, or sub-activities, without any textual input. We propose an iterative discriminative-generative approach which alternates between discriminatively learning the appearance of sub-activities from the videos' visual features to sub-activity labels and generatively modelling the temporal structure of sub-activities using a Generalized Mallows Model. In addition, we introduce a model for background to account for frames unrelated to the actual activities. Our approach is validated on the challenging Breakfast Actions and Inria Instructional Videos datasets and outperforms both unsupervised and weakly-supervised state of the art.

研究の動機と目的

  • 長時間の動画シーケンスにおける複雑で手続き的なアクティビティの無教師分割の課題に取り組む。
  • 現実世界の指導動画に一般的に見られる欠落したステップや順序のずれを含む、部分アクティビティの柔軟な時系列順序をモデル化する。
  • 反復的な最適化プロセスを通じて、部分アクティビティの視覚的外観表現とその時系列構造を同時に学習する。
  • 主なアクティビティに関係のない背景フレームを考慮し、セグメンテーションの正確性を向上させる。
  • 無教師アクティビティセグメンテーションにおいて最先端の性能を達成し、無教師および弱教師ありのベースラインを上回ること。

提案手法

  • 視覚的特徴から低次元埋め込み空間への線形マッピングを識別的アプローチで学習し、類似した部分アクティビティをクラスタリングし、異なるものを分離するためのランク損失を用いる。
  • 部分アクティビティの順列の分布をモデル化するために一般化マリウス分布(GMM)を採用し、基準順序を強制しつつも、現実世界のばらつきに対して柔軟性を確保する。
  • アクティビティに属さないフレームを特定・除外する背景モデルを導入し、セグメンテーションの整合性を向上させる。
  • 視覚的表現と時系列構造の最適化を交互に繰り返す反復的EM型フレームワークを採用し、反復ごとに両方のコンポonentを改善する。
  • 学習済みパラメータと観測された特徴に基づいて、フレームレベルのラベル(部分アクティビティおよび背景)を確率的推論スキームで割り当てる。
  • GMMの柔軟性を制御するための事前分布(ハイパーパrameter ρ₀)を導入し、基準順序と逸脱許容度のバランスを取る。

実験結果

リサーチクエスチョン

  • RQ1テキスト的・時系列的監視なしに、視覚的入力のみで複雑な動画アクティビティの最先端の無教師セグメンテーションを達成できるか?
  • RQ2欠落したステップや再順序化されたアクションを含む、部分アクティビティの時系列構造を、どのように柔軟にモデル化できるか?
  • RQ3長時間で未トリムされた動画シーケンスにおいて、背景モデルを組み込むことで、セグメンテーション性能がどの程度向上するか?
  • RQ4GMMに基づく時系列モデリングは、マルコフ連鎖的またはRNNベースのアプローチと比較して、グローバルな順序制約をどの程度うまく捉えられるか?
  • RQ5繰り返しの部分アクティビティを含むアクティビティではなぜ性能が低下するのか?また、このようなケースを処理できるようにモデルを拡張できるか?

主な発見

  • 提案手法は、Breakfast ActionsデータセットでF1スコア0.471を達成し、RNNベースや識別的クラスタリング手法を含む、すべての無教師および弱教師ありベースラインを上回る。
  • Inria Instructional Videosデータセットでは、ジャッカード指数47.1%およびMof 34.6%を達成し、無教師設定において最先端の結果を同等または上回る。
  • 'CPRを実施する'および'タイヤを交換する'の2つのアクティビティでは、繰り返しの部分アクティビティが原因で性能が低下し、単一モードのGMMではその繰り返しをモデル化できないことが示され、繰り返し処理の制限が明らかになった。
  • ρ₀ = 5の設定では、'タイヤを交換する'タスクでF1 = 0.41の同等の性能を達成し、事前分布の調整によって厳密な順序制約タスクの性能を向上させられることを示した。
  • 5つのアクティビティのうち3つにおいて、本手法は[1]を常に上回り、固定された順序制約よりも柔軟な順序モデリングの利点を示した。
  • 背景モデルは非アクティビティフレームを効果的に特定し、各アクティビティにおける背景フレームの割合が0.46〜0.83の範囲に分布し、セグメンテーションの整合性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。