Skip to main content
QUICK REVIEW

[論文レビュー] Predicting the Next Action by Modeling the Abstract Goal

Debaditya Roy, Basura Fernando|arXiv (Cornell University)|Sep 12, 2022
Human Pose and Action Recognition被引用数 6
ひとこと要約

本論文は、視覚的特徴と行動表現から潜在的ゴール分布を推定するための、変分再帰ネットワークを用いた新しい確率的抽象ゴールモデリング手法を提案する。候補となる次の行動のうち最も妥当なものを選ぶためにゴールの一貫性基準を導入することで、Epic-Kitchens55、EK100、EGTEA Gaze+ データセットにおいて最先端の性能を達成し、Epic-Kitchens55 の「見たことのあるキッチン」(S1)スプリットにおいて、トップ1の動詞、名詞、行動の正確さでそれぞれ+13.69、+11.24、+5.19の絶対的向上を達成した。

ABSTRACT

The problem of anticipating human actions is an inherently uncertain one. However, we can reduce this uncertainty if we have a sense of the goal that the actor is trying to achieve. Here, we present an action anticipation model that leverages goal information for the purpose of reducing the uncertainty in future predictions. Since we do not possess goal information or the observed actions during inference, we resort to visual representation to encapsulate information about both actions and goals. Through this, we derive a novel concept called abstract goal which is conditioned on observed sequences of visual features for action anticipation. We design the abstract goal as a distribution whose parameters are estimated using a variational recurrent network. We sample multiple candidates for the next action and introduce a goal consistency measure to determine the best candidate that follows from the abstract goal. Our method obtains impressive results on the very challenging Epic-Kitchens55 (EK55), EK100, and EGTEA Gaze+ datasets. We obtain absolute improvements of +13.69, +11.24, and +5.19 for Top-1 verb, Top-1 noun, and Top-1 action anticipation accuracy respectively over prior state-of-the-art methods for seen kitchens (S1) of EK55. Similarly, we also obtain significant improvements in the unseen kitchens (S2) set for Top-1 verb (+10.75), noun (+5.84) and action (+2.87) anticipation. Similar trend is observed for EGTEA Gaze+ dataset, where absolute improvement of +9.9, +13.1 and +6.8 is obtained for noun, verb, and action anticipation. It is through the submission of this paper that our method is currently the new state-of-the-art for action anticipation in EK55 and EGTEA Gaze+ https://competitions.codalab.org/competitions/20071#results Code available at https://github.com/debadityaroy/Abstract_Goal

研究の動機と目的

  • 観測された視覚的特徴と行動系列から抽象ゴールを暗黙的にモデル化することで、行動予測の不確実性を低減すること。
  • 視覚的特徴と行動表現の上での変分推論を用いて、潜在的ゴール分布を学習する確率的フレームワークの開発。
  • 特徴に基づくと行動に基づく抽象ゴール分布の間の一貫性を強制することで、次の行動予測を向上させること。
  • 未観測の環境、例えばEpic-Kitchens100の未確認キッチンなどに効果的に一般化できること。
  • 脚本のないエゴセントリック動画環境において、既存の決定的および確率的モデルを上回ること。

提案手法

  • モデルは、観測された行動系列からの視覚的特徴に条件付けられた変分再帰ネットワーク(VRNN)を用いて、特徴に基づく抽象ゴール分布を学習する。
  • 観測された行動とサンプリングされた抽象ゴールに条件付けられた分布から、複数の候補となる次の行動表現をサンプリングする。
  • 予測された次の行動表現から、生成的変分フレームワークを用いて行動に基づく抽象ゴール分布を学習する。
  • 特徴に基づくと行動に基づく抽象ゴール分布の間の乖離を測る新しいゴール一貫性損失を導入し、最も妥当な次の行動を選択する。
  • 行動予測のための交差エントロピー損失、潜在変数の正則化のためのKLD損失、およびゴール一貫性損失を組み合わせて、エンドツーエンドでモデルを訓練する。
  • 複数の行動候補をサンプリングし、ゴール一貫性を最大化するものを予測された次の行動として選択する。

実験結果

リサーチクエスチョン

  • RQ1視覚的特徴と行動系列から抽象ゴールをモデル化することで、行動予測の性能が向上するか?
  • RQ2特徴に基づくと行動に基づく抽象ゴールの間の一貫性を強制することで、予測精度がどのように向上するか?
  • RQ3抽象ゴールモデリングに確率的・変分的手法を用いることで、未確認の環境(例:未確認のキッチン)に一般化できるか?
  • RQ4各損失項(次の行動予測、抽象ゴール正則化、ゴール一貫性)の相対的寄与度は何か?
  • RQ5本手法は、Transformerベースのモデルを含む、決定的および確率的ベースラインをすべて上回るか?

主な発見

  • 提案手法は、Epic-Kitchens55 の「見たことのあるキッチン」(S1)スプリットにおいて、先行の最先端手法と比較してトップ1動詞正確さで+13.69の絶対的向上を達成した。
  • 同じS1スプリットにおいて、トップ1名詞正確さで+11.24、トップ1行動予測正確さで+5.19の絶対的向上を達成した。
  • EK55 の「未確認のキッチン」(S2)スプリットでは、トップ1動詞正確さで+10.75、名詞で+5.84、行動で+2.87の向上を達成した。
  • EGTEA Gaze+ では、トップ1名詞正確さで+9.9、動詞で+13.1、行動で+6.8の絶対的向上を達成した。
  • アブレーションスタディの結果、ゴール一貫性損失が最も寄与度が高く、全4つの損失項(NA、OG、NG、GC)が性能向上に顕著に寄与することが確認された。
  • モデルは、さまざまな予測時間窓においても高い性能を維持しており、0.5秒でのトップ5行動正確さは44.26%、2秒では42.90%を記録し、RU-LSTM や Temporal Aggregation ベースラインを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。