Skip to main content
QUICK REVIEW

[論文レビュー] Learning Self-Correctable Policies and Value Functions from Demonstrations with Negative Sampling

Yuping Luo, Huazhe Xu|arXiv (Cornell University)|Jul 12, 2019
Reinforcement Learning in Robotics参考文献 58被引用数 4
ひとこと要約

本稿では、自己修正可能な方策を可能にするために、専門家のデモから保守的extrapolated価値関数を学習する方法であるネガティブサンプリングを用いた価値反復(VINS)を提案する。未学習状態への過剰に楽観的な価値extrapolationを防ぐためにネガティブサンプリングを用いることで、VINSはサンプル効率を向上させ、スパarsely-rewardedロボット制御タスクにおける行動コーディングと強化学習のファインチューニングの両方で先行手法を上回る性能を発揮する。

ABSTRACT

Imitation learning, followed by reinforcement learning algorithms, is a promising paradigm to solve complex control tasks sample-efficiently. However, learning from demonstrations often suffers from the covariate shift problem, which results in cascading errors of the learned policy. We introduce a notion of conservatively-extrapolated value functions, which provably lead to policies with self-correction. We design an algorithm Value Iteration with Negative Sampling (VINS) that practically learns such value functions with conservative extrapolation. We show that VINS can correct mistakes of the behavioral cloning policy on simulated robotics benchmark tasks. We also propose the algorithm of using VINS to initialize a reinforcement learning algorithm, which is shown to outperform significantly prior works in sample efficiency.

研究の動機と目的

  • 分布シフトにより、方策と価値関数が未学習状態に一般化できない模倣学習における共変量シフト問題に対処すること。
  • 実行中の誤差が蓄積する原因となる、誤った価値関数extrapolationの問題を克服すること。
  • 示された軌道に近い未学習状態に低い値を割り当てることで、示された軌道に近づく価値関数を理論的に裏付けられた方法で学習すること。
  • Q関数とダイナミクスモデルをVINSで初期化することで、強化学習におけるサンプル効率を向上させ、広範なウォームアップの必要性を減らすこと。
  • VINSが行動コーディングの誤りを是正でき、ベンチマークとしてのロボット制御タスクにおいて、サンプル効率の面で先行手法を上回ることを実証すること。

提案手法

  • 示された軌道に近いがデモセットに含まれない状態に低い値を割り当てる保守的extrapolated価値関数の概念を導入し、方策の自己修正を促進すること。
  • ネガティブサンプリングを用いてこのような価値関数を学習するVINSアルゴリズムを設計し、ネガティブサンプルはデモ状態にガウスノイズを加えることで生成する。
  • デモ状態における教師あり学習と、デモセットに含まれない摂動状態における高い値をペナルティ化するネガティブサンプリング損失を組み合わせた損失関数を定式化する。
  • 次状態を予測するための教師あり学習を用いてダイナミクスモデルを学習し、価値最大化による行動選択を可能にする。
  • 学習された価値関数とダイナミクスモデルを用いて強化学習アルゴリズムを初期化し、Q関数のウォームアップにかかる必要性を減らす。
  • ダイナミクスモデルがデモデータから離れて不正確になる場合のロバストネスを向上させるために、行動コーディング方策の行動の周辺での行動探索を実施する。

実験結果

リサーチクエスチョン

  • RQ1未学習状態に保守的にextrapolateする価値関数を設計でき、模倣学習における自己修正可能な方策を可能にできるか?
  • RQ2ネガティブサンプリングを用いることで、デモデータから遠く離れた領域での楽観的予測を避ける価値関数をどのように学習できるか?
  • RQ3VINSで初期化された強化学習アルゴリズムが、先行手法と比較してどの程度サンプル効率が向上するか?
  • RQ4ネガティブサンプリング、ダイナミクスモデル、およびBC方策の周辺での行動探索といった各コンポonentが、VINS全体のパフォーマンスに果たす貢献度はどの程度か?
  • RQ5提案手法が、スパarsely-rewardedロボット制御タスクにおける行動コーディング方策の誤りを是正できるか?

主な発見

  • VINSは、シミュレーテッドロボット制御タスクにおける行動コーディング性能を顕著に向上させ、Pick-100では75.7%、Push-100では55.2%の成功率を達成した。これはBC単独の66.8%および37.3%を上回る。
  • アブレーションスタディの結果、ネガティブサンプリングを除去すると、Pick-100での性能は48.5%に低下し、誤ったextrapolationを防ぐためにネガティブサンプリングが不可欠であることが示された。
  • 行動コーディングの監視なしにVINSを適用した場合、性能は著しく低下(Pick-100で28.5%)し、BC方策が安定な方策初期化に不可欠であることが明らかになった。
  • オラクルダイナミクスモデルを用い、BC方策なしでもPick-100で51.4%の成功率を達成した。これは、ダイナミクスモデルの品質が主なボトルネックであることを示唆している。
  • RLの初期化にVINSを用いることで、Nair et al. (2018) よりも優れた最先端手法を上回り、より少ない環境インタラクションで近似的に最適な成功率に到達した。
  • 学習曲線の結果、VINSで初期化されたRLは収束が早く、特に初期訓練段階で高いパフォーマンスに到達するためのサンプル数が少ないことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。