Skip to main content
QUICK REVIEW

[論文レビュー] Joint Discovery of Object States and Manipulation Actions

Jean-Baptiste Alayrac, Josev Sivic|HAL (Le Centre pour la Communication Scientifique Directe)|Feb 9, 2017
Human Pose and Action Recognition参考文献 41被引用数 6
ひとこと要約

本稿では、手動アノテーションを用いずに、未編集動画から物体の状態(例:満タン/空のカップ)とそれに対応する操作行動(例:注ぐ)を共同で学習するフレームワークを提案する。時間的整合性制約を備えた判別的クラスタリング損失を用いることで、行動と物体状態を同時に局所化・クラスタリングし、相互監視によって両タスクの性能が向上する。実世界の動画データセット上で検証され、7つの発見された行動と状態を含む。

ABSTRACT

Many human activities involve object manipulations aiming to modify the object state. Examples of common state changes include full/empty bottle, open/closed door, and attached/detached car wheel. In this work, we seek to automatically discover the states of objects and the associated manipulation actions. Given a set of videos for a particular task, we propose a joint model that learns to identify object states and to localize state-modifying actions. Our model is formulated as a discriminative clustering cost with constraints. We assume a consistent temporal order for the changes in object states and manipulation actions, and introduce new optimization techniques to learn model parameters without additional supervision. We demonstrate successful discovery of seven manipulation actions and corresponding object states on a new dataset of videos depicting real-life object manipulations. We show that our joint formulation results in an improvement of object state discovery by action recognition and vice versa.

研究の動機と目的

  • 手動アノテーションを一切用いずに、未編集動画から物体の状態と操作行動を自動で発見すること。
  • 行動が明確に区別される物体状態の遷移を引き起こすものと仮定し、状態変化と行動のトリガーの間の時間的整合性をモデル化すること。
  • 共同学習フレームワークにおいて、両タスクの相互監視を活用することで、物体状態の発見と行動局所化の両方の性能を向上させること。
  • テキストベースの検索を用いて、ノイズが多い現実世界のデータにスケーラブルに適用すること。
  • 日常的物体操作を含む新しいデータセット上で、その耐障害性と有効性を示すこと。

提案手法

  • 空間的・時間的制約を備えた判別的クラスタリング損失として問題を定式化し、物体状態と操作行動を共同で学習する。
  • 行動が明確に区別される物体状態を時間的に分離するよう強制する共同整合性損失を導入し、時間的妥当性を保証する。
  • 追加の教師信号を一切用いずに、動画クリップと時間的構造のみを用いて、非凸最適化手法によりモデルパラメータを学習する。
  • 字幕を変換したテキストに対してスライディングウインドウSVM分類器を適用し、説明動画から候補となる行動クリップを検索する。
  • 2-gram特徴を用いた10語のスライディングウインドウを用いて動画クリップの行動関連性をスコア化し、最高スコアのウインドウの前後にそれぞれ5秒と15秒をトリミングする。
  • 各行動ごとに上位20件の検索クリップに対して共同推論を実行し、共同モデルを用いて状態と行動の予測を同時に最適化する。

実験結果

リサーチクエスチョン

  • RQ1手動アノテーションを一切用いずに、未編集動画から物体状態と操作行動を共同で発見できるか?
  • RQ2状態と行動の共同モデリングは、独立して発見する場合と比較して性能をどのように向上させるか?
  • RQ3本手法は、ナラティブ付き説明動画から自動的に取得されたノイズの多いクリップに対しても一般化可能か?
  • RQ4時間的整合性制約が、発見された状態と行動の品質に与える影響は何か?
  • RQ5状態発見と行動認識の間の相互監視は、両タスクの性能向上に寄与するか?

主な発見

  • クリーニングされたデータセット上では、共同モデルが物体状態発見で平均F1スコア36%を達成し、ベースライン手法を著しく上回った。
  • ノイズが多い自動取得クリップでは、共同手法が平均状態発見F1スコア0.36を達成したのに対し、ベースライン(Cstrsのみ)は0.24にとどまった。
  • 行動局所化に関しては、ノイズのあるクリップ上での平均F1が0.24に達し、ベースライン(0.11)と比較して120%の向上を示した。
  • クリーニングされた設定下では、共同手法が状態発見で平均F1 0.62、行動局所化で0.44を達成し、高品質な入力データでも優れた性能を示した。
  • 本手法は「コーヒーを注ぐ」や「ホイールを取り外す」など、7つの明確に区別される操作行動とその関連する物体状態を正常に発見できた。
  • 共同定式化により、両タスクが同時に向上し、状態発見が行動認識の恩恵を受けるとともに、逆に行動認識も状態発見の向上に寄与することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。