Skip to main content
QUICK REVIEW

[論文レビュー] What Would You Do? Acting by Learning to Predict

Adam W. Tow, Niko Sünderhauf|arXiv (Cornell University)|Mar 8, 2017
Reinforcement Learning in Robotics参考文献 24被引用数 4
ひとこと要約

本論文では、1枚の画像から視覚的状態遷移を予測することで、人間のデモを模倣できる新しいロボットタスク学習手法である Learning from Prediction (LfP) を提案する。PredNetモデルを用いて視覚的観測から次の状態を予測するように訓練することで、ロボットは未観測の状態に一般化し、ロボット上でのアクション実行を最小限に抑えながらタスクを実行でき、シーケンスベースの予測を用いることでmovetoposタスクで100%の成功を達成し、単一画像からの予測でも高い成功率を達成した。

ABSTRACT

We propose to learn tasks directly from visual demonstrations by learning to predict the outcome of human and robot actions on an environment. We enable a robot to physically perform a human demonstrated task without knowledge of the thought processes or actions of the human, only their visually observable state transitions. We evaluate our approach on two table-top, object manipulation tasks and demonstrate generalisation to previously unseen states. Our approach reduces the priors required to implement a robot task learning system compared with the existing approaches of Learning from Demonstration, Reinforcement Learning and Inverse Reinforcement Learning.

研究の動機と目的

  • ロボットが運動学的マッピング、報酬信号、またはアクション-状態アノテーションを必要とせずに、人間の視覚的デモから直接タスクを学習できるようにすること。
  • ロボット固有の運動学的特性、報酬関数、またはデモレーターのアクションシーケンスに依存しないように、ロボット学習における事前の仮定を減らすこと。
  • デモ中に観測された視覚的状態遷移のみを用いて、未観測の環境的状態への一般化を達成すること。
  • YouTubeの動画など、ロボットに依存しないデモ(例:動画)を用いて、人間からロボットへのタスク転送を可能にすること。
  • すべてのアクションの結果を事前に予測することで、最適なアクションを選択する前に、ロボット上でのアクション実行を最小限に抑えること。

提案手法

  • 人間のデモの決定論的シーケンスを用いて、単一画像からの次の視覚的状態を予測するPredNetアーキテクチャを訓練し、単一画像からの推論を可能にする。
  • 人間のデモから観測された状態遷移のシーケンスを用いて、モデルが未観測の状態に一般化できるように訓練する。
  • 同じモデルをロボットが実行した軌道でファインチューニングすることで、ロボット自身のアクションの結果を予測できるようにする。
  • 各状態で、すべての可能なアクションを、その予測された次の状態と人間デモレーターの予測された次の状態とを比較することで評価する。
  • 自ロボットの予測結果と人間の予測された次の状態との間の視覚的差を最小にするアクションを選択する。
  • 特に単一画像からの予測が信頼できない場合に、過去の状態履歴を組み込むことで予測性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1人間のデモのアクションや運動学的特性にアクセスできない状況でも、視覚的状態遷移のみを用いてロボットが人間のタスクを模倣できるか?
  • RQ2タスク実行中に、単一画像からの状態予測モデルが、未観測の環境的状態にどの程度一般化できるか?
  • RQ3シーケンス履歴を用いることで、単一画像予測と比較して、予測精度とタスク成功確率がどの程度向上するか?
  • RQ4同じ予測モデルを人間デモの予測とロボットのアクション結果の予測の両方で使用できるか?
  • RQ5予測誤差がタスク実行に与える影響は何か?失敗は初期段階の予測不正確さに起因しているか?

主な発見

  • シーケンスベースの状態予測を用いた場合、LfPアプローチはmovetoposタスクで100%の成功率を達成し、すべての可能なオブジェクトの初期位置をカバーした。
  • 単一画像からの予測を用いた場合、最初の状態の予測が正しいと94.0%の軌道が成功したが、最初の状態の予測が間違っている軌道はすべて失敗した。
  • すべての失敗した軌道は、最初の状態で誤った予測が起因しており、初期段階での予測誤差が失敗の主な原因であることが示された。
  • 成功した軌道のうち、最初の状態の予測が間違っていたのは3.6%にとどまり、正しい最初の状態予測から始まった軌道で後で失敗したものは一切なかった。
  • 例示された事例では、単一画像からの予測が悪い状態でも、直前の状態のシーケンスを経由することで正しく予測できることが示され、文脈の恩恵が確認された。
  • プッシュプルタスクでは、単一画像からの正解予測が71.4%に達し、成功した軌道の96.4%が正しい最初の状態予測から始まった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。