[論文レビュー] Rethinking Sim2Real: Lower Fidelity Simulation Leads to Higher Sim2Real Transfer in Navigation
この論文は、脚部ロボットナビゲーションにおけるシミュレーションから現実への転移性能が、より高精度なシミュレーションによって向上するとする仮定に挑戦する。低精度な運動学的シミュレーションで、実際のロボットから収集した現実的なアクチュエータノイズを組み込むことで、高精度な動的シミュレータで訓練した場合よりも優れた現実世界での性能を達成した。これは、正確なノイズモデリングを伴う低精度なシミュレーションが、シミュレーションから現実への一般化性能を向上させることを示している。
If we want to train robots in simulation before deploying them in reality, it seems natural and almost self-evident to presume that reducing the sim2real gap involves creating simulators of increasing fidelity (since reality is what it is). We challenge this assumption and present a contrary hypothesis -- sim2real transfer of robots may be improved with lower (not higher) fidelity simulation. We conduct a systematic large-scale evaluation of this hypothesis on the problem of visual navigation -- in the real world, and on 2 different simulators (Habitat and iGibson) using 3 different robots (A1, AlienGo, Spot). Our results show that, contrary to expectation, adding fidelity does not help with learning; performance is poor due to slow simulation speed (preventing large-scale learning) and overfitting to inaccuracies in simulation physics. Instead, building simple models of the robot motion using real-world data can improve learning and generalization.
研究の動機と目的
- 高精度なシミュレーションが脚部ロボットナビゲーションにおけるシミュレーションから現実への転移性能を向上させるかどうかを調査すること。
- 実際のロボットから得た現実的なアクチュエータノイズをモデリングすることで、シミュレーションと現実世界の性能ギャップを是正すること。
- 運動学的ポリシーをノイズ注入で訓練した場合と、高精度なシミュレータで訓練した動的ポリシーとを比較し、一般化性能が優れているかどうかを評価すること。
- 動的シミュレーションにおける過学習を、訓練用シミュレータと評価用シミュレータの性能差を測定することで定量化すること。
- シミュレーションの精度を簡素化しつつ、ノイズモデリングによる現実性の向上により、シミュレーションから現実への転移性能を向上させられることを実証すること。
提案手法
- 空室で、ボストンダイナミクス社のスポットロボットに対して、分離された速度指令と結合された速度指令の両方を用いて、現実世界のアクチュエータノイズを収集した。
- 収集したノイズデータに2変量正規分布をフィットさせ、前進、横方向、回転速度における不確実性をモデリングした。
- 訓練中に、状態更新の前にポリシーが予測した速度にサンプリングしたノイズを追加することで、運動学的シミュレーションにノイズを注入した。
- 割合的ポリシー最適化(PPO)を用いて高レベルナビゲーションポリシーを訓練し、一般化された利得推定(GAE)を適用し、割引率を0.99、GAEパラメータを0.95とした。
- 形状化された測地的距離、衝突ペナルティ(-0.03)、転倒ペナルティ(-5.0)、成功報酬(10.0)、スラックペナルティ(-0.002)、後退運動ペナルティ(-0.03)を含む報酬関数を設計した。
- 成功率をホールドアウトされたシーンで測定することで、シミュレーション内(sim2sim)および運動学的シミュレーションから動的シミュレーションへの転移設定(kinematic-to-dynamic transfer)の両方で、2種類の低レベルコントローラー(RaibertおよびMPC)を用いてポリシーを評価した。
実験結果
リサーチクエスチョン
- RQ1現実的なアクチュエータノイズを組み込んだ低精度な運動学的シミュレーションで訓練した場合、高精度な動的シミュレータで訓練した場合よりも、シミュレーションから現実への転移性能が向上するか?
- RQ2アクチュエータノイズモデリングは、異なるシミュレータやコントローラー間でのポリシー一般化にどのように影響するか?
- RQ3動的ポリシーが、訓練に使った特定のシミュレータおよびコントローラーに過学習する程度はどの程度か?
- RQ4動的ポリシーとノイズ注入付き運動学的ポリシーの間で、訓練用シミュレータと評価用シミュレータの性能差は、どちらが大きいか?
- RQ5すべての方向への同時指令によるノイズの結合(カップリング)が、分離されたノイズモデリングよりも、より優れた現実世界での性能をもたらすか?
主な発見
- Raibertコントローラーを用いて、iGibson内でのAliengoで、ノイズを注入した運動学的ポリシーが68.9%の成功率を達成したのに対し、動的ポリシーは45.4%にとどまり、動的制御下でも優れた性能を示した。
- 動的ポリシーでは、訓練ステップ数が増えるにつれて、訓練用シミュレータ(Habitat-Dynamic)と評価用シミュレータ(iGibson-Dynamic)の性能差が拡大し、過学習の兆候が示された(例:A1では5000万ステップ後に27.2%の差)。
- カップリングノイズモデル(σₓ=0.054 m/s, σᵧ=0.065 m/s, σω=2.599 deg/s)は、分離モデル(σₓ=0.036 m/s, σᵧ=0.044 m/s, σω=1.468 deg/s)を上回る性能を示したが、両者ともノイズモデリングなしのケースに比べて向上した。
- 現実世界のアクチュエータノイズは非対称的かつ非全方向的であった:前進方向の標準偏差は0.097 m、横方向は0.139 mであり、0.5 m/sで速度飽和を実装することが妥当であった。
- ボストンダイナミクス社のRaibertコントローラーのような高度にチューニングされたコントローラーですら、脚部ロボットが顕著な追従誤差を示すため、シミュレーションにおけるノイズモデリングの導入が有効であると結論づけた。
- A1、Aliengo、Spotの全ロボットにおいて、ノイズ注入付き運動学的ポリシーの成功率は、動的ポリシーを常に上回り、低精度なシミュレーションに現実的なノイズを組み込むことで、シミュレーションから現実への転移性能が向上することを確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。