Skip to main content
QUICK REVIEW

[論文レビュー] What Went Wrong? Closing the Sim-to-Real Gap via Differentiable Causal Discovery

Peide Huang, Xilun Zhang|arXiv (Cornell University)|Jun 28, 2023
Time Series Analysis and Forecasting被引用数 4
ひとこと要約

本論文では、ロボット操作におけるシミュレーションから現実へのギャップを埋めるために、差分可能な因果発見フレームワークであるCOMPASSを提案する。COMPASSは、環境パラメータと軌道差の因果関係を学習することで、エンドツーエンドで解釈可能かつ効率的なパラメータチューニングを可能にし、シミュレーションおよび実世界の実験においてベースラインと比較して、軌道整合性とタスク成功確率の両面で顕著な向上を達成する。

ABSTRACT

Training control policies in simulation is more appealing than on real robots directly, as it allows for exploring diverse states in an efficient manner. Yet, robot simulators inevitably exhibit disparities from the real-world ebut{dynamics}, yielding inaccuracies that manifest as the dynamical simulation-to-reality (sim-to-real) gap. Existing literature has proposed to close this gap by actively modifying specific simulator parameters to align the simulated data with real-world observations. However, the set of tunable parameters is usually manually selected to reduce the search space in a case-by-case manner, which is hard to scale up for complex systems and requires extensive domain knowledge. To address the scalability issue and automate the parameter-tuning process, we introduce COMPASS, which aligns the simulator with the real world by discovering the causal relationship between the environment parameters and the sim-to-real gap. Concretely, our method learns a differentiable mapping from the environment parameters to the differences between simulated and real-world robot-object trajectories. This mapping is governed by a simultaneously learned causal graph to help prune the search space of parameters, provide better interpretability, and improve generalization on unseen parameters. We perform experiments to achieve both sim-to-sim and sim-to-real transfer, and show that our method has significant improvements in trajectory alignment and task success rate over strong baselines in several challenging manipulation tasks.

研究の動機と目的

  • シミュレーションと現実世界のダイナミクスの差を引き起こす主要なシミュレータパラメータを特定・チューニングすることで、ロボット制御におけるシミュレーションから現実へのギャップを解消すること。
  • 個別ケースごとの手動選択に依存しないように、パラメータチューニングプロセスを自動化・スケーラブルにすること。
  • 不要なパラメータをプルーニングし、因果関係を明らかにすることで、解釈性と一般化性能を向上させること。
  • 差分可能なダイナミクスモデリングを用いて、シミュレータパラメータのエンドツーエンド最適化を可能にすること。
  • シミュレーションからシミュレーションおよびシミュレーションから現実への転移設定において、軌道整合性およびタスク成功確率の両面で優れた性能を示すこと。

提案手法

  • COMPASSは、環境パラメータからシミュレーションと現実世界のロボット・オブジェクト相互作用における軌道差に至る差分可能なマッピングとして、シミュレーションから現実へのギャップを定式化する。
  • 因果グラフを同時に学習することで、環境パラメータとシミュレーションから現実へのギャップの関係をモデル化し、構造的な探索空間のプルーニングを可能にする。
  • 差分可能な因果モデルを逆伝播することで、軌道差を最小化するようにエンドツーエンドでシミュレータパラメータを最適化する。
  • 因果グラフは初期段階で完全接続として初期化され、学習された因果的依存関係に基づいて反復的にプルーニングされ、効率性と解釈性が向上する。
  • 本手法は実世界の軌道データとシミュレートされた軌道データで学習され、ポリシーの性能はシミュレート環境および現実環境の両方で評価される。
  • 物理的パラメータ(質量、減衰、摩擦など)の勾配ベース最適化を可能にするために、差分可能な物理エンジンが活用される。

実験結果

リサーチクエスチョン

  • RQ1ロボット操作タスクにおけるシミュレーションから現実へのギャップに最も寄与しているシミュレータ環境パラメータは何か?
  • RQ2手動による個別ケース選択に依存せずに、最も影響力のあるパラメータを自動的に同定・優先順位付けできるか?
  • RQ3差分可能な因果モデルは、シミュレーションから現実へのパラメータチューニングの効率性と解釈性を向上させられるか?
  • RQ4因果構造を組み込むことで、シミュレーションから現実への転移における一般化性能と性能はどの程度向上するか?
  • RQ5勾配ベースおよび勾配フリーのベースラインと比較して、本手法は軌道整合性およびタスク成功確率の面でどの程度優れているか?

主な発見

  • Push-Iタスクにおいて、COMPASSは2イテレーションで有効なパラメータ探索空間を67次元からわずか3次元にまで縮小し、最も影響力のあるパラメータとして cube@dyna@mass、cube@dyna@damping、cube@dyna@friction_sliding を同定した。
  • 実世界でのテストでは、COMPASSは0.70 ± 0.28のタスク成功確率を達成し、NPDR(0.40 ± 0.21)およびEXI-Net(0.50 ± 0.22)を顕著に上回った。
  • 軌道整合性の結果では、COMPASSはNPDRおよびEXI-Netよりも速やかに収束し、より低い軌道差を達成した。ロール、ピッチ、位置の軌道において、視覚的に優れた整合性を示した。
  • COMPASSが学習した因果グラフは、不要なパラメータを効果的にプルーニングしており、事前の仮定なしに主要な物理的要因を同定できることを示した。
  • シミュレーションからシミュレーションの評価では、COMPASSで訓練されたエージェントは、ノーマルおよびベースライン手法よりも高い成功確率を示し、ポリシーの一般化性能の向上を確認した。
  • フレームワークにより、シミュレータパラメータのエンドツーエンド最適化が可能となり、最適化イテレーションの進行に伴い、環境パラメータが真値に徐々に近づいた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。