Skip to main content
QUICK REVIEW

[論文レビュー] Composable Action-Conditioned Predictors: Flexible Off-Policy Learning for Robot Navigation

Gregory Kahn, Adam Villaflor|arXiv (Cornell University)|Oct 16, 2018
Reinforcement Learning in Robotics参考文献 14被引用数 10
ひとこと要約

本稿では、自己収集したオフポリシー・データから、視覚検出器を自動ラベルとして用い、複数のイベントキュー(衝突、速度、レーン位置、ドアなど)を予測するフレームワークであるComposable Action-Conditioned Predictors (CAPs)を提案する。行動に依存する予測モデルをこれらのキューで訓練することで、再訓練を必要とせず、テスト時に柔軟かつ即時のタスク合成が可能となり、RCカーにおいて衝突回避、進行方向制御、ドア接近といった多様な目標を達成した。

ABSTRACT

A general-purpose intelligent robot must be able to learn autonomously and be able to accomplish multiple tasks in order to be deployed in the real world. However, standard reinforcement learning approaches learn separate task-specific policies and assume the reward function for each task is known a priori. We propose a framework that learns event cues from off-policy data, and can flexibly combine these event cues at test time to accomplish different tasks. These event cue labels are not assumed to be known a priori, but are instead labeled using learned models, such as computer vision detectors, and then `backed up' in time using an action-conditioned predictive model. We show that a simulated robotic car and a real-world RC car can gather data and train fully autonomously without any human-provided labels beyond those needed to train the detectors, and then at test-time be able to accomplish a variety of different tasks. Videos of the experiments and code can be found at https://github.com/gkahn13/CAPs

研究の動機と目的

  • 各タスクに対して事前に定義された手動でコーディングされた報酬関数に依存せずに、汎用的なロボット学習を可能にすること。
  • 人間が提供するラベルが検出器のトレーニングデータを除き存在しない状況で、オフポリシーのデータを自律的に収集して学習できること。
  • 学習済みのイベント予測子を再結合することで、テスト時に柔軟なタスク合成を可能にすること。
  • コンピュータビジョン検出器をイベントキューの自動ラベルとして統合し、エンド・ツー・エンドの自律的スキル習得を可能にすること。
  • テスト時に報酬関数のみを変更することで、1つのポリシーが複数のナビゲーションタスクを達成できることを示すこと。

提案手法

  • ロボットが現実世界またはシミュレーション環境で自律的に収集したオフポリシー・データを活用する。
  • レーンやドアなどの検出器を用いて、データ内のイベントキューを自動的にラベル付けし、人間によるアノテーション付き報酬を回避する。
  • 現在の観測値と行動を入力として、将来のイベント状態を予測する行動に依存する予測モデル(CAPs)を訓練する。
  • 1つの観測値・行動ペアから複数のイベントキューを同時に予測できるマルチヘッドニューラルネットワークアーキテクチャを採用する。
  • すべてのイベントキューにおける予測誤差を統合した微分可能な損失関数を用い、ディープラーニングによる共同学習を可能にする。
  • テスト時に、予測されたイベントキューからタスク固有の報酬関数を合成し、計画またはオンライン最適化によって行動を選択する。

実験結果

リサーチクエスチョン

  • RQ1人間が提供する報酬がなく、オフポリシーで自己収集したデータから、ロボットが複数のイベントキューを予測できるか?
  • RQ2学習済みのイベント予測子をテスト時に柔軟に再結合することで、再訓練なしに多様なナビゲーションタスクを達成できるか?
  • RQ3視覚検出器を自動ラベルとして用いることで、制御ポリシーの完全な自律的学習が可能になるか?
  • RQ4報酬関数のみをテスト時に変更した場合、フレームワークが新しいタスクにどの程度一般化できるか?
  • RQ5同じCAPsモデルが、衝突回避と目的指向ナビゲーション(例:ドアへ向かう)の両方を、同じベースとなる予測子を使って学習できるか?

主な発見

  • CAPsフレームワークは、実世界のRCカーを75mのループで走行させ、衝突回避の学習のみで100%のルート走行率と100%の衝突回避率を達成した。
  • ドアに到達するタスクでは、同じCAPsモデルがループを走破する際の成功率を80%にまで向上させ、報酬関数にドアサブレワードを追加したことで、ドアを17%多く確認した。
  • 複数の目的を組み合わせた場合、GC-DQLはループを走破できず、100%の試行で衝突したのに対し、本手法は優れた性能を示した。
  • 同じCAPsモデルが、報酬関数をテスト時に変更するだけで、衝突回避、進行方向制御、ドア接近の複数のタスクを達成可能であり、真の組み合わせ可能性を示した。
  • モデルは進行方向、速度、ドアの有無といったイベントキューを高い精度で予測し、複雑な行動の計画に有効に寄与した。
  • 衝突回避、進行方向制御、ドア接近を含むマルチオブジェクティブタスクにおいて、98%のルート走行率と80%の成功率を達成し、最良の設定では0%の衝突率を記録した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。