Skip to main content
QUICK REVIEW

[論文レビュー] Follow the Gradient: Crossing the Reality Gap using Differentiable Physics (RealityGrad)

Jack Collins, Ross Brown|arXiv (Cornell University)|Sep 10, 2021
Robotic Path Planning Algorithms参考文献 26被引用数 4
ひとこと要約

本論文では、微分可能物理学を用いて、現実世界のロールアウトとシミュレーションパラメータの反復的精錬を通じて、ロボットの軌道を最適化する新規な sim2real メソッドであるRealityGradを紹介する。勾配ベースの軌道最適化とシステム同定を組み合わせることで、デスクトップCPU上で1イタレーションあたり22分未塔でタスク空間誤差を66%低減し、ロボットアームの現実ギャップを顕著に縮小した。

ABSTRACT

We propose a novel iterative approach for crossing the reality gap that utilises live robot rollouts and differentiable physics. Our method, RealityGrad, demonstrates for the first time, an efficient sim2real transfer in combination with a real2sim model optimisation for closing the reality gap. Differentiable physics has become an alluring alternative to classical rigid-body simulation due to the current culmination of automatic differentiation libraries, compute and non-linear optimisation libraries. Our method builds on this progress and employs differentiable physics for efficient trajectory optimisation. We demonstrate RealitGrad on a dynamic control task for a serial link robot manipulator and present results that show its efficiency and ability to quickly improve not just the robot's performance in real world tasks but also enhance the simulation model for future tasks. One iteration of RealityGrad takes less than 22 minutes on a desktop computer while reducing the error by 2/3, making it efficient compared to other sim2real methods in both compute and time. Our methodology and application of differentiable physics establishes a promising approach for crossing the reality gap and has great potential for scaling to complex environments.

研究の動機と目的

  • 動的特性やノイズの差異により、シミュレーションで訓練されたポリシーが実際のロボットに展開した際に失敗するという、ロボット分野における継続的な現実ギャップを解消すること。
  • ドメインランダマイゼーションなどの既存の sim2real メソッドが、しばしば保守的または非効率的なポリシーを生じさせることを克服すること。
  • 実世界のポリシー性能とシミュレーションモデルの正確性を同時に改善する、効率的でスケーラブルかつ反復的なアプローチを開発すること。
  • 実ロボットデータと微分可能物理学を用いた勾配ベース最適化により、オンラインかつリアルタイムでのシミュレーションモデルの適応を可能にすること。
  • 微分可能シミュレータが制御最適化に加え、正確なシステム同定にも利用可能であることを実証し、長期的なシミュレーションから現実への移行性を向上させること。

提案手法

  • 微分可能物理学エンジンを用いて、シミュレーションの動的特性を通り抜ける勾配を計算し、制御ポリシーとモデルパラメータの勾配ベース最適化を可能にする。
  • 微分可能動的特性を備えたモデル予測制御(MPC)を用い、現在のモデルパラメータを用いて、K個の最適な軌道をシミュレーション内で生成する。
  • 生成された最適な軌道を用いてニューラルネットワークポリシーを訓練し、微分可能ポリシー・ネットワークを生成する。
  • 訓練済みポリシーを実際のロボットでロールアウトし、現実世界の軌道データを収集する。
  • シミュレーション内でのシステム同定を、実ロボットの軌道とシミュレートされた軌道の差を最小化する勾配降下法を用いて、シミュレータパラメータに対して行う。
  • 全パイプラインを反復する——軌道最適化、ポリシー訓練、現実世界ロールアウト、システム同定——により、ポリシー性能とシミュレーションの忠実性を段階的に向上させる。

実験結果

リサーチクエスチョン

  • RQ1微分可能物理学は、一元的で統合的なパイプライン内で、ロボットの軌道とシミュレーションパラメータの効率的で勾配ベースの最適化を可能にするか?
  • RQ2現実世界のロボットロールアウトは、実ロボットの動的特性をモデル化する微分可能物理学シミュレータの正確性をどの程度向上させるか?
  • RQ3微分可能物理学を用いた反復的 sim2real ループにより、タスク空間誤差としての現実ギャップはどの程度縮小可能か?
  • RQ4提案手法は、ドメインランダマイゼーションで訓練されたポリシーと比較して、より効率的かつ非保守的であるか?
  • RQ5この手法は計算的に効率的であり、高価なGPUを必要とせず、標準的なデスクトップハードウェアでも動作するか?

主な発見

  • RealityGradは、デフォルトパラメータの129.79mから1イタレーション後に47.81mへと、シミュレートされた軌道と実際のロボット軌道の間の累積ユークリッド誤差を63%低減した。
  • システム同定における残差誤差は、デフォルトパラメータの350,155.24から1イタレーション後に28.87に低下し、シミュレーションと現実世界の動的特性が強く一致していることを示している。
  • 2回目のイタレーション後には、残差誤差がさらに12.26に低下し、シミュレートされた軌道と実際の軌道の間の累積誤差は59.98mにまで低下し、継続的な改善が確認された。
  • 1回の完全なイタレーションは、デスクトップCPU(AMD 3970、128GB RAM)上で22分未塔で完了し、高い計算効率を示した。
  • この手法は、特にジョイントダンピング値といった重要な物理的パラメータを正確に同定でき、シミュレーションモデルが実ロボットの動作に正確にキャリブレーション可能であることを示した。
  • 向上したシミュレーションモデルにより、ポリシーの一般化性能が向上し、収束が早くなり、その後のイタレーションでより効率的で振動の少ない動作を示すようになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。