Skip to main content
QUICK REVIEW

[論文レビュー] Auto-Tuned Sim-to-Real Transfer

Yuqing Du, Olivia Watkins|arXiv (Cornell University)|Apr 15, 2021
Domain Adaptation and Few-Shot Learning参考文献 18被引用数 4
ひとこと要約

本論文では、状態推定や報酬設計を必要とせず、実世界の生のRGB動画のみを用いて、シミュレータのシステムパラメータを実世界のダイナミクスに自動的に調整する自己調整手法を提案する。パrameterチューニングを探索問題として定式化し、現在のパラメータが真の値よりも高いか低いかを予測するための検索パrameterモデル(SPM)を用いることで、特にピンインホールやキャビネット開閉のようなダイナミクスに敏感なタスクにおいて、ナーブなドメインランダム化に比べてシミュレーションから実世界への転送性能が顕著に向上する。

ABSTRACT

Policies trained in simulation often fail when transferred to the real world due to the `reality gap' where the simulator is unable to accurately capture the dynamics and visual properties of the real world. Current approaches to tackle this problem, such as domain randomization, require prior knowledge and engineering to determine how much to randomize system parameters in order to learn a policy that is robust to sim-to-real transfer while also not being too conservative. We propose a method for automatically tuning simulator system parameters to match the real world using only raw RGB images of the real world without the need to define rewards or estimate state. Our key insight is to reframe the auto-tuning of parameters as a search problem where we iteratively shift the simulation system parameters to approach the real-world system parameters. We propose a Search Param Model (SPM) that, given a sequence of observations and actions and a set of system parameters, predicts whether the given parameters are higher or lower than the true parameters used to generate the observations. We evaluate our method on multiple robotic control tasks in both sim-to-sim and sim-to-real transfer, demonstrating significant improvement over naive domain randomization. Project videos and code at https://yuqingd.github.io/autotuned-sim2real/

研究の動機と目的

  • ドメインランダム化のための手動設計に依存しないようにすることで、ロボット工学におけるシミュレーションから実世界への転送ギャップを解消すること。
  • 実世界の動画から得られる生のRGB観測のみを用いて、シミュレータのシステムパラメータを実世界のダイナミクスに自動的に補正すること。
  • シミュレーションチューニング中に、計器化された実世界の状態や報酬関数の知識が不要であることを実現すること。
  • シミュレーションのダイナミクスを現実に近づけることで、ポリシーの一般化性能と実世界での実行成功率を向上させること。

提案手法

  • シミュレーションから実世界へのパrameterチューニング問題を、段階的にシミュレーションパラメータを調整して実世界の値に近づける探索問題として再定式化する。
  • 観測と行動の系列に加え、現在のシミュレーションパラメータを入力とし、パラメータが真の実世界値よりも高いか、低いか、または近いかを予測する検索パラメータモデル(SPM)を提案する。
  • 異なるパラメータ設定で生成されたシミュレートされた軌道を用いて対照的学習を実施することで、SPMを訓練し、過大評価と過小評価のパラメータ値を区別できるようにする。
  • SPMの予測結果を基に、反復的な更新によってシミュレーションパラメータを真の実世界値に近づける強化学習ポリシーを導出し、制御する。
  • パラメータが自動チューニングされた後、シミュレータが形状報酬を伴う大規模かつ多様なデータを生成できる能力を活用し、頑健なポリシーを訓練する。
  • 本手法をシミュレーションからシミュレーション、およびシミュレーションから実世界への転送設定の両方で適用し、補正には実世界のRGB動画のみを用い、真の状態や報酬関数の知識は一切不要とする。

実験結果

リサーチクエスチョン

  • RQ1実世界の生のRGB観測のみを用いて、シミュレータのシステムパラメータを実世界のダイナミクスに自動的にチューニングできるか?
  • RQ2パラメータチューニングを「高すぎるか低すぎるかを予測する」探索問題として再定式化することで、ナーブなドメインランダム化に比べて、より正確で頑健なシミュレーションから実世界への転送が可能になるか?
  • RQ3自動チューニングされたパラメータを用いて学習したモデルは、実世界の状態や報酬関数の知識が得られない状況下でも、実世界のロボット制御タスクにどの程度一般化できるか?
  • RQ4ピンインホールやキャビネット開閉のようなダイナミクスに敏感なタスクにおいて、本手法は標準的なドメインランダム化に比べてどの程度の性能を示すか?

主な発見

  • 本手法は、WalkerやBall-in-Cupのようなタスクにおいて、ナーブなドメインランダム化に比べて、成功確率の面で一貫した改善を示した。
  • ロープを用いたピンインホールタスクでは、本手法は一貫した動きで穴に向かって進み、まれに成功を記録したが、ドメインランダム化ベースラインは適切な運動を開始できなかった。
  • キャビネットスライドタスクでは、本手法は一貫してラジオをスライドオープンさせることができたが、ドメインランダム化ベースラインは一貫して過剰にスライドし、失敗した。
  • 本手法は、ドメインランダム化ベースラインが使用するシミュレーションステップの20%未満で、同等またはより良い性能を達成した。
  • アブレーションスタディの結果、Cheetahのようなパラメータが学習しやすい環境では本手法が頑健であることが示されたが、Ball-in-Cupのような感度の高いダイナミクスではやや不安定であった。これは、パラメータ同定の難易度に依存する可能性を示唆している。
  • 真の値が初期のランダム化範囲外にあった場合でも、本手法はシステムパラメータを正しく学習できたが、そのような状況では収束がより困難であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。