Skip to main content
QUICK REVIEW

[論文レビュー] Learning Representations for Predicting Future Activities

Mohammadreza Zolfaghari, Özgün Çiçek|arXiv (Cornell University)|May 9, 2019
Human Pose and Action Recognition参考文献 39被引用数 7
ひとこと要約

本稿では、自己教師あり枠組みPreFActを提案する。この枠組みは、複数の仮説を用いたアプローチにより、動的環境表現を学習することで、将来の行動を予測する。行動とオブジェクトの予測を分離し、将来状態の自然言語キャプションを生成する。Epic-KitchensおよびBreakfastデータセットで優れた性能を達成し、予測の不確実性推定が適切にキャリブレートされており、行動およびオブジェクトの面で強力なゼロショット一般化性能を示している。

ABSTRACT

Foreseeing the future is one of the key factors of intelligence. It involves understanding of the past and current environment as well as decent experience of its possible dynamics. In this work, we address future prediction at the abstract level of activities. We propose a network module for learning embeddings of the environment's dynamics in a self-supervised way. To take the ambiguities and high variances in the future activities into account, we use a multi-hypotheses scheme that can represent multiple futures. We demonstrate the approach by classifying future activities on the Epic-Kitchens and Breakfast datasets. Moreover, we generate captions that describe the future activities

研究の動機と目的

  • ラベルなし動画データから環境状態の動的表現を学習することで、将来の行動予測を向上させること。
  • 将来の行動の非決定的性質に対処するため、複数の妥当な将来をモデル化する複数仮説方式を用いること。
  • 未観測の行動-オブジェクト組み合わせへの一般化を向上させるために、行動とオブジェクトの予測を分離すること。
  • 学習済み表現を用いて、予測された将来状態を記述する自然言語キャプションを生成すること。
  • 長期間にわたる、曖昧な将来のシナリオにおける予測の不確実性キャリブレーションと耐性を評価すること。

提案手法

  • 将来予測モジュールは、過去および現在の観測からの空間時系列特徴を、複数の将来行動状態の表現に変換する。
  • モデルは将来の予測を行動とオブジェクトの別々の表現に分離することで、オブジェクトクラス間でのゼロショット一般化を可能にする。
  • 複数の仮説方式により、1つの入力に対して複数の候補となる将来行動予測を生成し、将来ダイナミクスにおける不確実性と曖昧性を捉える。
  • 言語モジュールは、予測された将来表現から記述的キャプションを生成し、将来状態の自然言語解釈を可能にする。
  • 自己教師あり学習は、非トリムド動画データ上で時系列的対照学習を用いて実施され、教師あり設定では行動およびオブジェクトラベルのみを監視として用いる。
  • 各仮説ごとの信頼度スコアを用いて不確実性推定を統合し、信頼性図およびスパarsificationプロットを用いて評価する。

実験結果

リサーチクエスチョン

  • RQ1自己教師あり表現学習は、将来の行動予測に向けた長期的ダイナミクスを効果的に捉えられるか?
  • RQ2複数の仮説アプローチは、将来の行動に内在する曖昧さとばらつきをどの程度うまくモデル化できるか?
  • RQ3行動とオブジェクトの予測を分離することで、ゼロショット一般化がどの程度向上するか?
  • RQ4モデルの不確実性推定は、将来の予測に対してどの程度キャリブレートされているか?
  • RQ5予測された表現は、正解の将来行動と整合する自然言語キャプションに効果的にマッピングできるか?

主な発見

  • 本モデルは、Epic-KitchensおよびBreakfastデータセットの両方で将来の行動予測において優れた性能を達成しており、複数仮説予測による精度向上が確認された。
  • スパースフィケーションプロットから、高不確実性予測を除外することで一貫した精度向上が見られ、不確実性推定が情報的かつ適切にキャリブレートされていることが示された。
  • 信頼性図は、信頼度スコアが実際の正解率に比例して増加することを示しており、不確実性予測が適切にキャリブレートされていることを確認した。
  • 未観測の行動-オブジェクト組み合わせに対して効果的に一般化しており、分離された行動-オブジェクト表現のおかげで強力なゼロショット一般化能力を示した。
  • 定性的な結果から、生成されたキャプションが、Epic-Kitchensのような挑戦的なエゴセントリックな設定でも、正解の将来行動とよく一致していることがわかった。
  • 本モデルのスパースフィケーション曲線とオラクル曲線の差が比較的大きく、将来の行動予測が依然として根本的に高い誤り率を有する困難なタスクであることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。