Skip to main content
QUICK REVIEW

[論文レビュー] A User's Guide to Calibrating Robotics Simulators

Bhairav Mehta, Ankur Handa|arXiv (Cornell University)|Nov 17, 2020
Reinforcement Learning in Robotics参考文献 31被引用数 4
ひとこと要約

本稿は、ロボット工学におけるシミュレーションから現実への転送アルゴリズムの評価を標準化するためのシミュレーションパラメータ推定(SIPE)ベンチマークを導入する。実世界の軌道を用いてパラメータ推定手法を評価し、手動または固定アクションアプローチと比較して、学習されたポリシーおよびディスクラミネータが安定性と性能を向上させることを示している。粒子ベースの手法、例えばADRやSimOptは、歩行タスクにおいて強力なゼロショット一般化を示している。

ABSTRACT

Simulators are a critical component of modern robotics research. Strategies for both perception and decision making can be studied in simulation first before deployed to real world systems, saving on time and costs. Despite significant progress on the development of sim-to-real algorithms, the analysis of different methods is still conducted in an ad-hoc manner, without a consistent set of tests and metrics for comparison. This paper fills this gap and proposes a set of benchmarks and a framework for the study of various algorithms aimed to transfer models and policies learnt in simulation to the real world. We conduct experiments on a wide range of well known simulated environments to characterize and offer insights into the performance of different algorithms. Our analysis can be useful for practitioners working in this area and can help make informed choices about the behavior and main properties of sim-to-real algorithms. We open-source the benchmark, training data, and trained models, which can be found at https://github.com/NVlabs/sim-parameter-estimation.

研究の動機と目的

  • シミュレーションパラメータ推定およびシミュレーションから現実への転送アルゴリズムを評価するための標準化されたベンチマークの不足に対処すること。
  • ロボット工学シミュレーションにおけるシステム同定およびキャリブレーション手法を統一したフレームワークで比較すること。
  • 異なる軌道生成戦略(デモ対比・学習されたポリシー)がパラメータ推定性能に与える影響を分析すること。
  • アクティブドメインランダマイゼーションおよび最適化ベースの手法における、学習された報酬と真値の状態差の影響を評価すること。
  • 推定されたパラメータを用いた下流の強化学習タスクにおけるゼロショット一般化性能を評価すること。

提案手法

  • SIPEベンチマークは、シミュレーテッド環境のセット、実ロボットからのエキスパート軌道、およびパラメータ推定用に訓練されたポリシーを提供する。
  • パラメータ推定は、実世界の軌道を用いて質量や摩擦などのシミュレータパラメータを同定するシステム同定問題として定式化される。
  • 著者らは、デモ(遠隔操作またはエキスパート)と、訓練済みポリシーによって生成された軌道を用いて、固定アクションではなくポリシーから導出されたアクションを比較する。
  • アクティブドメインランダマイゼーション(ADR)およびSimOptは、MSEベースのコスト関数と学習されたディスクラミネータの両方を用いて評価される。
  • ゼロショット転送評価プロトコルは、推定されたパラメータを用いて下流の強化学習エージェントの性能を測定し、ターゲット環境でのみ訓練されたエージェントとの結果を正規化する。
  • ベンチマークには、再現可能性および今後の研究のためのオープンソースコード、データセット、および訓練済みモデルが含まれる。

実験結果

リサーチクエスチョン

  • RQ1デモ対比・学習されたポリシーという異なる軌道生成手法が、パラメータ推定の安定性および正確性に与える影響は何か?
  • RQ2アクティブドメインランダマイゼーションおよび最適化ベースのパラメータ推定において、学習された報酬(ディスクラミネータを介して)と真値の状態差の使用がもたらす影響は何か?
  • RQ3推定されたパラメータを用いて下流の強化学習訓練を行う場合、粒子ベースの手法(例:ADR、SimOpt)は未観測の環境にどの程度一般化できるか?
  • RQ4下流タスクの性能を損なわせることなく、事後分布の回復を緩和し、単純な粒子サンプリングに置き換えることは可能か?
  • RQ5コスト関数の選択が、多様なロボットタスクにおけるパラメータ推定の収束性および分散に与える影響は何か?

主な発見

  • 学習されたポリシーによって生成された軌道を用いることで、固定アクションのデモと比較して、パラメータ推定の分散が著しく低減され、アルゴリズムの安定性が向上する。
  • 一部の環境では性能が低下するものの、ポリシーによって生成された軌道は複数のアルゴリズムにおける学習を安定化させ、推定プロセスにおけるノイズ低減の価値を示している。
  • ディスクラミネータによる学習された報酬の使用は、特にADRにおいて分散と不安定性を増加させるが、SimOptはこのアプローチから利益を得ている。
  • ADR や SimOpt といった粒子ベースの手法は、強力なゼロショット一般化性能を達成しており、効果的なシミュレーションから現実への転送には、完全な事後分布の回復が必ずしも必要でないことを示している。
  • 本ベンチマークは、正確な事後分布推定がなくても、収束した粒子からのサンプリングが、下流タスクの高い性能をもたらすことを示しており、実世界への展開における実用的効率性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。