Skip to main content
QUICK REVIEW

[論文レビュー] Learning Active Task-Oriented Exploration Policies for Bridging the Sim-to-Real Gap

Jacky Liang, Saumya Saxena|arXiv (Cornell University)|Jun 2, 2020
Reinforcement Learning in Robotics参考文献 36被引用数 5
ひとこと要約

本論文では、ロボット操作におけるシミュレーションから現実への適用のギャップを埋めるために、タスク関連のシステムパラメータを明示的に特定する能動的でタスク指向の探索方策の学習を提案する。一般的なモデル精度ではなく、タスクの下流性能を最適化することで、探索を最適化することにより、特に探索予算が限られた状況下でも、タスクに無関係な探索に比べて著しく優れた現実世界のタスク性能を達成する。

ABSTRACT

Training robotic policies in simulation suffers from the sim-to-real gap, as simulated dynamics can be different from real-world dynamics. Past works tackled this problem through domain randomization and online system-identification. The former is sensitive to the manually-specified training distribution of dynamics parameters and can result in behaviors that are overly conservative. The latter requires learning policies that concurrently perform the task and generate useful trajectories for system identification. In this work, we propose and analyze a framework for learning exploration policies that explicitly perform task-oriented exploration actions to identify task-relevant system parameters. These parameters are then used by model-based trajectory optimization algorithms to perform the task in the real world. We instantiate the framework in simulation with the Linear Quadratic Regulator as well as in the real world with pouring and object dragging tasks. Experiments show that task-oriented exploration helps model-based policies adapt to systems with initially unknown parameters, and it leads to better task performance than task-agnostic exploration.

研究の動機と目的

  • ドメインランダマイゼーションやモデルフリー微調整に依存しないようにすることで、ロボット政策学習におけるシミュレーションから現実へのギャップを解消すること。
  • すべてのシステムパラメータを同等に扱うタスクに無関係な探索の限界を克服し、特に探索予算が制限された状況下で性能が劣ることのない方法を提供すること。
  • タスク性能に最も感受性が高い動的パラメータの正確さを最大化するように、探索方策を訓練するフレームワークの構築。
  • 再訓練なしに、多様なシステムパラメータとタスク目標に対して学習済みの探索方策を一般化可能にすること。
  • 特定されたパラメータを用いて、モデルベースの軌道最適化により、シミュレーションと現実を橋渡しすること。

提案手法

  • システムパラメータとタスク目標の分布を用いて、タスクコスト感受性で重み付けされた動的予測誤差を損失に含めるように、シミュレーション内で探索方策を訓練する。
  • システムパラメータとタスク目標の両方について、有限差分近似を組み込んだネストドサンプリング法を用いて、探索方策の勾配を計算する。
  • 学習済みの探索方策を現実世界で適用し、質量や摩擦などの未知の動的パラメータのシステム同定(Sys-Id)のための軌道を収集する。
  • 同定されたパラメータをモデルベースの軌道最適化器(例:LQR または直接的軌道最適化)に供給し、現実世界での実行用のタスク方策を生成する。
  • 探索行動をタスクに重要なパラメータに感受性を持たせるよう設計する — 例:引きずりタスクにおいて、ねじり摩擦を調べるために、物体の重心から遠くから開始する。
  • 解析的モデル(LQR)と完全な動的シミュレータ(例:PyBullet での実装)を併用して、シミュレーションと現実世界の両方のタスクにフレームワークを適用する。

実験結果

リサーチクエスチョン

  • RQ1タスク指向の探索は、タスクに無関係な探索に比べて、より良い現実世界のタスク性能をもたらすようなシステムパラメータを特定する上で優れているか?
  • RQ2下流タスクコスト感受性を最適化することで、探索予算が限られた状況下で未知の現実世界の動的特性への適応が向上するか?
  • RQ3再訓練なしに、多様なシステムパラメータとタスク目標にわたって、1つの学習済み探索方策が一般化可能か?
  • RQ4タスク指向の探索は、ランダムまたは受動的探索に比べて、システム同定の正確性と最終的なタスクコストにおいて優れているか?
  • RQ5高次元パラメータ空間において、タスク指向の探索は、タスクに無関係な手法に比べて、探索の有効次元を低減するか?

主な発見

  • ボックスを引きずるタスクにおいて、タスク指向の探索は、タスクに無関係な探索やランダム探索に比べ、現実世界でのタスク実行コストの平均値と標準偏差を顕著に低減した。
  • ボックスを引きずるタスクにおいて、タスク指向方策は、タスクに無関係な方策に比べて平均コストを50%以上削減した。各手法で48回の試行を実施し、ボックスの質量や表面材の違いを考慮した。
  • タスク指向の探索方策は、ねじり摩擦パラメータに対してより感受性が高い軌道を生成しており、物体の重心から遠くから開始することで、その効果が裏付けられた。
  • LQR シミュレーションタスクにおいて、タスク指向方策はトレーニング中により低いレグレット比を達成し、タスクに無関係な探索に比べてパラメータ推定の正確性が優れていた。
  • ポーリングタスクにおいて、タスク指向方策は、タスクに関連するカップの質量をより効果的に同定し、現実世界での実行成功率を向上させた。
  • フレームワークは、再訓練なしに、さまざまなシステムパラメータとタスク目標にわたって一般化でき、学習済み探索方策の強靭性と転送可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。