Skip to main content
QUICK REVIEW

[論文レビュー] Generative Hybrid Representations for Activity Forecasting with No-Regret Learning

Jiaqi Guan, Ye Yuan|arXiv (Cornell University)|Apr 12, 2019
Human Pose and Action Recognition参考文献 56被引用数 5
ひとこと要約

本稿では、可逆生成モデリングとGumbel-Softmaxトリックを用いて、エゴセントリック動画における離散的行動と連続的軌道を同時に予測する深層生成モデルを提案する。EPIC-KITCHENSで最先端の性能を達成しており、正確な尤度を用いた不確実性のモデル化と、理論的・実験的裏付けをもつ無悔しオンライン学習により継続的適応を可能にする。

ABSTRACT

Automatically reasoning about future human behaviors is a difficult problem but has significant practical applications to assistive systems. Part of this difficulty stems from learning systems' inability to represent all kinds of behaviors. Some behaviors, such as motion, are best described with continuous representations, whereas others, such as picking up a cup, are best described with discrete representations. Furthermore, human behavior is generally not fixed: people can change their habits and routines. This suggests these systems must be able to learn and adapt continuously. In this work, we develop an efficient deep generative model to jointly forecast a person's future discrete actions and continuous motions. On a large-scale egocentric dataset, EPIC-KITCHENS, we observe our method generates high-quality and diverse samples while exhibiting better generalization than related generative models. Finally, we propose a variant to continually learn our model from streaming data, observe its practical effectiveness, and theoretically justify its learning efficiency.

研究の動機と目的

  • エゴセントリック動画における人間行動のハイブリッド的性質(離散的行動と連続的運動)をモデル化する課題に対処すること。
  • 正確な尤度計算を備えた生成モデルを用いて、正確で多様かつ不確実性を考慮した将来の行動予測を実現すること。
  • 理論的根拠を有する無悔しオンラインファインチューニング機構を用いて、ストリーミングデータからの継続的学習を可能にすること。
  • 行動の変動性と不確実性にさらされた状況下でも、予測の一般化性能とロバスト性を向上させること。

提案手法

  • 可逆生成モデリングを用いて、連続的軌道と離散的行動の連合分布を学習し、正確な尤度計算を可能にする。
  • Gumbel-Softmaxトリックを適用して、連続的軌道サンプルを条件とした離散的行動のモデル化を行う。
  • 対称的クロスエントロピー損失を用いて、軌道と行動の生成を同時に最適化する。
  • ストリーミングデータに対してのみ追加の線形層をファインチューニングする無悔しオンライン学習アルゴリズムを導入する。
  • 後向きに考慮するモデリング(hindsight modeling)を用いて平均レグレットを計算し、無悔し収束を実験的に検証する。
  • 3Dシーン構造をORB-SLAMを用いて再構築し、エゴセントリック動画と過去の位置をコンテキストとして軌道入力に使用する。

実験結果

リサーチクエスチョン

  • RQ1生成モデルは、エゴセントリック動画における離散的行動と連続的軌道の連合分布を効果的にモデル化できるか?
  • RQ2GAN や VAE と比較して、正確な尤度計算が予測性能と不確実性の特徴付けを向上させるか?
  • RQ3本モデルは、マルチモーダル行動予測において、判別的ベースラインよりも一般化性能に優れるか?
  • RQ4提案されたオンラインファインチューニング手法は無悔し的であるか?また、時間経過に伴って学習効率を維持できるか?
  • RQ5複数の妥当な行動が考えられるような曖昧な将来行動において、モデルは不確実性をどれほど適切に扱えるか?

主な発見

  • 提案モデルは、EPIC-KITCHENSデータセットにおける連続的軌道と行動の同時予測において、生成的および判別的ベースラインを上回る性能を発揮した。
  • モデルは多様で高品質な将来サンプルを生成でき、特に不確実な状況下で上位K個の行動予測におけるリCALLが向上した。
  • 正確な尤度計算が可能であるため、逆クロスエントロピーなどのサンプルベースの指標の精密な最適化が可能になった。
  • 無悔しファインチューニングによるオンライン学習は、テストデータでの性能を向上させ、より多くのストリーミングデータが得られるほど大きな向上が見られた。
  • 軌道および行動予測の両方における平均レグレット曲線がゼロに収束し、無悔し学習の主張を実験的に裏付けた。
  • 可視化結果から、予測された軌道が行動分布に意味のある影響を与えていることが示され、高い行動確率が妥当な行動と一致していた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。