Skip to main content
QUICK REVIEW

[論文レビュー] Model-based Behavioral Cloning with Future Image Similarity Learning

Alan H.B. Wu, AJ Piergiovanni|arXiv (Cornell University)|Oct 8, 2019
Reinforcement Learning in Robotics参考文献 37被引用数 6
ひとこと要約

本論文は、実世界のロボットタスクにおけるゼロショットポリシー学習を可能にするモデルベースの行動乗法フレームワークを提案する。この手法は、専門家の軌道からのみ学習する確率的かつアクションに依存する将来画像予測モデルを学習し、専門家の結果に最も類似する将来の画像を生成するアクションを選択することで、ゼロショットポリシー学習を実現する。本手法は、実世界のロボットターゲットアプローチタスクで94%の成功率を達成し、先行手法の2.5倍の性能を発揮した。これは、実世界の試行データを一切使用せず、視覚的将来予測と類似度学習を活用した結果である。

ABSTRACT

We present a visual imitation learning framework that enables learning of robot action policies solely based on expert samples without any robot trials. Robot exploration and on-policy trials in a real-world environment could often be expensive/dangerous. We present a new approach to address this problem by learning a future scene prediction model solely on a collection of expert trajectories consisting of unlabeled example videos and actions, and by enabling generalized action cloning using future image similarity. The robot learns to visually predict the consequences of taking an action, and obtains the policy by evaluating how similar the predicted future image is to an expert image. We develop a stochastic action-conditioned convolutional autoencoder, and present how we take advantage of future images for robot learning. We conduct experiments in simulated and real-life environments using a ground mobility robot with and without obstacles, and compare our models to multiple baseline methods.

研究の動機と目的

  • 限られた専門家のデモンストレーションからのみ、ポリシー学習を実世界で行うことを可能にすること。
  • 行動乗法における共変量シフトを解消するため、学習済みの将来予測モデルを用いて未学習状態に一般化すること。
  • アクション選択のためのクライアントとして視覚的将来画像類似度を活用することで、模倣学習の性能を向上させること。
  • 非専門家のアクションや未学習状態にも一般化可能な確率的かつアクションに依存する畳み込みオートエンコーダを構築すること。
  • オブジェクトのアノテーションや報酬信号なしに、実世界およびシミュレーテッド環境で高い性能を達成すること。

提案手法

  • 専門家の軌道のみを用いて、現在の観測値とアクションから将来の画像を予測する確率的かつアクションに依存する畳み込みオートエンコーダを学習する。
  • モデルは、確率的事前分布を推定するために再帰的ニューラルネットワーク(LSTM)を用い、確率的環境におけるロバストネスを向上させる。
  • 将来の画像類似度ネットワークを同時に学習し、予測された将来の画像と専門家が提供する将来の画像との類似度を評価する。
  • アクションポリシーは、予測された画像と専門家の将来画像との類似度を最大化するアクションを選択することで導出され、学習済みのクライアントとして機能する。
  • フレームワークはゼロ試行設定で動作し、追加の実世界インタラクションを一切必要とせず、専門家の動画とアクションペアに依存する。
  • 学習済みの状態遷移モデルの一般化能力を活用することで、未学習状態や未学習アクションに一般化する。

実験結果

リサーチクエスチョン

  • RQ1専門家の軌道からのみ学習された将来画像予測モデルは、非専門家のアクションや未学習状態にも一般化可能か?
  • RQ2将来画像類似度を統合することで、ゼロ試行の模倣学習における行動乗法の性能はどのように向上するか?
  • RQ3予測モデルに確率的事前分布を導入することで、実世界環境における視覚的将来予測の品質は向上するか?
  • RQ4提案手法は、実世界およびシミュレーテッド環境において、標準的な行動乗法およびベースライン模倣学習手法をどの程度上回るか?
  • RQ5本手法は、実世界環境における不要な物体やマークのないターゲットに対してどの程度頑健か?

主な発見

  • 提案手法は、実世界のロボットターゲットアプローチタスクで94%の成功率を達成し、次善のベースラインの2.5倍の向上を示した。
  • 障害物回避のシミュレーションでは、確率的モデルを用いた場合に63%の成功率を達成し、決定的モデルおよび行動乗法ベースラインを著しく上回った。
  • 確率的状態モデルはDTW類似度スコア5.98を達成し、すべての手法の中で最低であり、専門家のデモンストレーションと高い軌道類似度を示した。
  • 本手法は不要な物体を無視し、オブジェクトアノテーションなしにターゲットへ到達でき、不要な物体が存在する状況でもDTWスコア4.94を達成した。
  • 将来画像類似度モデルにより、専門家のクエリなしに効果的なゼロショットポリシー学習が可能となり、未学習状態や未学習アクションへの一般化が良好に実現された。
  • オートエンコーダに確率的事前分布を導入することで、画像生成品質が向上し、ポリシーの一般化性能にも寄与した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。