Skip to main content
QUICK REVIEW

[論文レビュー] Sequential Learning of Movement Prediction in Dynamic Environments using LSTM Autoencoder

Meenakshi Sarkar, Debasish Ghose|arXiv (Cornell University)|Oct 12, 2018
Human Pose and Action Recognition参考文献 7被引用数 5
ひとこと要約

本論文では、動的ロボット環境における将来の動画フレームを予測するため、状態とアクションに条件付けられたLSTMオートエンコーダーを提案する。入力フレームを低次元特徴に符号化し、将来の状態を再構築することで、わずか5,000のトレーニングシーケンスのみで5フレーム先の予測を高精度に達成しており、移動障害物を伴う強化学習ベースのナビゲーションへの応用可能性を示している。

ABSTRACT

Predicting movement of objects while the action of learning agent interacts with the dynamics of the scene still remains a key challenge in robotics. We propose a multi-layer Long Short Term Memory (LSTM) autoendocer network that predicts future frames for a robot navigating in a dynamic environment with moving obstacles. The autoencoder network is composed of a state and action conditioned decoder network that reconstructs the future frames of video, conditioned on the action taken by the agent. The input image frames are first transformed into low dimensional feature vectors with a pre-trained encoder network and then reconstructed with the LSTM autoencoder network to generate the future frames. A virtual environment, based on the OpenAi-Gym framework for robotics, is used to gather training data and test the proposed network. The initial experiments show promising results indicating that these predicted frames can be used by an appropriate reinforcement learning framework in future to navigate around dynamic obstacles.

研究の動機と目的

  • ロボットの行動がシーンのダイナミクスに影響を与える動的環境における物体の運動を予測する課題に対処すること。
  • 手動ラベル付きデータに依存せずに、多様な軌道に一般化可能な教師なし学習フレームワークを開発すること。
  • エージェントのアクションに条件付けた予測を可能にすることで、未知の地形におけるリアルタイムパスプランニングを支援すること。
  • ピixeL単位のダイナミクスではなく、高レベルの空間的特徴に焦点を当てることで計算効率を向上させること。
  • ROS-GazeboおよびOpenAI-Gymを用いたシミュレーテッドロボティクス環境で、モデルの予測能力を検証すること。

提案手法

  • 入力画像シーケンスを低次元特徴ベクトルに変換するため、事前学習済みのエンコーダーネットワークを使用する。
  • エンコーダ-デコーダー構造を備えたマルチレイヤーLSTMオートエンコーダーに、特徴シーケンスを入力する。
  • 将来のフレームを予測するために、デコーダーをエージェントの行動および符号化された状態に条件付けする。
  • 予測された特徴ベクトルを事前学習済みのデコーダーネットワークを用いて再構築し、ピクセルレベルの動画フレームを生成する。
  • 再構築誤差を最小化するために、平均二乗誤差損失関数を最適化に用いる。
  • 勾配の流れを向上させ、スパースデータにおける特徴学習を改善するために、画像反転(I(i,j) = 255 - I(i,j))を適用する。

実験結果

リサーチクエスチョン

  • RQ1LSTMオートエンコーダーは、動的ロボティクス環境における構造のないラベルなしデータから、動画シーケンスの時間的規則性を学習できるか?
  • RQ2アクションおよび状態に条件付けられたデコーディングは、標準的なオートエンコーダーと比較して、将来のフレーム予測精度をどの程度向上させるか?
  • RQ3画像反転は、低信号・スパースな視覚的データにおける動画予測の学習をどの程度向上させるか?
  • RQ4わずか5,000のトレーニングシーケンスのみを用いて、多様な軌道およびゴール状態に一般化できるか?
  • RQ5予測されたフレームは、強化学習フレームワークにおけるパスプランニングを効果的に支援できるか?

主な発見

  • 画像反転を適用した場合、入力画像シーケンスの再構築が成功し、非反転入力と比較して空間的特徴の回復が顕著に向上した。
  • 画像反転により、スパースデータにおける消失勾配問題が解消され、安定した学習とより優れた表現学習が可能になった。
  • わずか5,000のシーケンス(5フレームの1,000シーケンス)で学習した後、最大5フレーム先の予測を合理的な精度で行えるようになった。
  • 予測されたフレームには一貫性のある運動パターンが現れ、シーケンス全体にわたりロボットの軌道が明確に可視化された。
  • 事前学習済みエンコーダーおよびデコーダーの使用により、エンドツーエンドのピクセルレベルモデリングと比較して計算コストが低減され、学習効率が向上した。
  • アクションに条件付けられたデコーダーにより、文脈に即した予測が可能となり、エージェントの行動が将来のシーン進化に与える影響を捉えることができた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。