Skip to main content
QUICK REVIEW

[論文レビュー] Predictive Learning: Using Future Representation Learning Variantial Autoencoder for Human Action Prediction

Runsheng Yu, Shi Zhenyu|arXiv (Cornell University)|Nov 25, 2017
Human Pose and Action Recognition参考文献 26被引用数 5
ひとこと要約

本稿では、将来のフレームを生成することで、近い将来の行動に強く関連する特徴を学習させることを目的とした、未学習の枠組みであるFuture Representation Learning Variational Autoencoder (FL-VAE) を提案する。変分オートエノード(VAE)を用いて将来のフレームを生成させることで、モデルが将来の行動に強く因果関係を持つ特徴を学習するよう促される。UTおよびUCF101データセットにおける実験の結果、特に部分的観測下においても、FL-VAEは最先端の手法を上回ることを示し、将来の生成が行動予測のための表現学習を向上させることを実証した。

ABSTRACT

The unsupervised Pretraining method has been widely used in aiding human action recognition. However, existing methods focus on reconstructing the already present frames rather than generating frames which happen in future.In this paper, We propose an improved Variantial Autoencoder model to extract the features with a high connection to the coming scenarios, also known as Predictive Learning. Our framework lists as following: two steam 3D-convolution neural networks are used to extract both spatial and temporal information as latent variables. Then a resample method is introduced to create new normal distribution probabilistic latent variables and finally, the deconvolution neural network will use these latent variables generate next frames. Through this possess, we train the model to focus more on how to generate the future and thus it will extract the future high connected features. In the experiment stage, A large number of experiments on UT and UCF101 datasets reveal that future generation aids Prediction does improve the performance. Moreover, the Future Representation Learning Network reach a higher score than other methods when in half observation. This means that Future Representation Learning is better than the traditional Representation Learning and other state- of-the-art methods in solving the human action prediction problems to some extends.

研究の動機と目的

  • 重要なフレームが出現する前に行う行動予測の課題に取り組むために、将来の行動に強く因果関係を持つ特徴を学習すること。
  • 過去のフレームを再構築することから、将来のフレームを生成することに焦点を移すことで、行動予測のための表現学習を向上させること。
  • 生成学習を通じて将来に関連する特徴を暗黙的に抽出できるようにする自己教師付きフレームワークを開発すること。
  • 将来の表現学習が、従来の表現学習よりも早期行動予測において優れた性能を発揮することを検証すること。
  • 異なる生成コンポーネント(過去 vs. 未来)およびアーキテクチャ的選択(二重ストリーム、データ拡張)が予測精度に与える相対的寄与度を調査すること。

提案手法

  • 二重ストリーム3D-CNN(C3D)ネットワークがRGBフレームとオプティカルフローを処理し、過去の動画セグメントからの空間的・時間的特徴を抽出する。
  • 変分オートエノード(VAE)がこれらの特徴を潜在変数にエンコードし、再構成サンプリングを用いて標準正規分布を強制的に維持する。
  • マルチストリームのデコンボリューションデコーダーが将来のRGBフレームおよびオプティカルフローを生成し、再構成損失を通じて将来予測可能な特徴を学習できるようにする。
  • モデルは、将来のフレームの再構成損失と、潜在空間を正則化するためのKLダイバージェンス項の組み合わせを用いて事前学習される。
  • 分類器は学習された潜在特徴上で訓練され、全システムがエンドツーエンドで微調整される。
  • 過学習を軽減し一般化性能を向上させるために、ランダムクリッピングおよびマルチスケールクローリングによるデータ拡張が適用される。

実験結果

リサーチクエスチョン

  • RQ1将来のフレーム生成は、早期の人間行動予測のための学習された表現の質を向上させることができるか?
  • RQ2将来のフレームを再構築することを目的としたVAEの学習は、過去のフレームを再構築する場合よりも優れた特徴学習をもたらすか?
  • RQ3将来の生成モデリングを過去の生成モデリングと比較した場合、予測性能にどのような差が生じるか?
  • RQ4将来のジェネレータ、二重ストリームネットワーク、データ拡張といった異なるアーキテクチャ的コンポーネントが、モデルの精度に果たす相対的寄与度は何か?
  • RQ5部分的観測(例:動画の初期セグメント)下において、将来の表現学習は性能向上にどの程度寄与するか?

主な発見

  • FL-VAEは、UTおよびUCF101データセットの両方で最先端の性能を達成しており、特に部分的観測条件下で顕著な優位性を示している。
  • 将来のRGBおよびオプティカルフローの生成を出力とするモデルが、他のすべてのバリエーションを上回っており、将来のフレーム予測が特徴学習を向上させることを示している。
  • 観測が動画全体の50%未満に制限される状況では、将来の生成モデルが過去の生成モデルよりも予測精度の向上にはるかに顕著な寄与をしている。
  • 二重ストリームC3Dネットワーク(RGB + オプティカルフロー)が性能向上に最も寄与しており、次に将来の生成ネットワーク、そしてデータ拡張が続く。
  • 高いドロップアウト率は最小限の改善しかもたらさず、この設定では他の正則化手法よりも有効性が低いことが示唆された。
  • 100%の観測比でもモデルは強力な性能を維持しており、将来の生成学習が現在の行動認識にも寄与していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。