Skip to main content
QUICK REVIEW

[論文レビュー] DTC: Deep Tracking Control

Fabian Jenelten, Junzhe He|arXiv (Cornell University)|Sep 27, 2023
Robotic Path Planning Algorithms被引用数 1
ひとこと要約

本論文では、モデルベースの軌道最適化と深層強化学習を組み合わせることで、スパースで挑戦的な地形においても頑健で高精度な歩行を実現するハイブリッド制御フレームワークDTC(Deep Tracking Control)を提案する。オンラインでの軌道最適化によって生成された最適化された足場に追従するように深層ニューラルネットワークポリシーを学習させることで、DTCは優れた足場配置の正確性、滑りやすいまたは変形しやすい表面への高い耐性、多様な地形タイプおよび最適化手法への一般化性能を達成した。これは、シミュレーションおよびANYmalロボットにおける実世界でのデプロイメントで実証された。

ABSTRACT

Legged locomotion is a complex control problem that requires both accuracy and robustness to cope with real-world challenges. Legged systems have traditionally been controlled using trajectory optimization with inverse dynamics. Such hierarchical model-based methods are appealing due to intuitive cost function tuning, accurate planning, generalization, and most importantly, the insightful understanding gained from more than one decade of extensive research. However, model mismatch and violation of assumptions are common sources of faulty operation. Simulation-based reinforcement learning, on the other hand, results in locomotion policies with unprecedented robustness and recovery skills. Yet, all learning algorithms struggle with sparse rewards emerging from environments where valid footholds are rare, such as gaps or stepping stones. In this work, we propose a hybrid control architecture that combines the advantages of both worlds to simultaneously achieve greater robustness, foot-placement accuracy, and terrain generalization. Our approach utilizes a model-based planner to roll out a reference motion during training. A deep neural network policy is trained in simulation, aiming to track the optimized footholds. We evaluate the accuracy of our locomotion pipeline on sparse terrains, where pure data-driven methods are prone to fail. Furthermore, we demonstrate superior robustness in the presence of slippery or deformable ground when compared to model-based counterparts. Finally, we show that our proposed tracking controller generalizes across different trajectory optimization methods not seen during training. In conclusion, our work unites the predictive capabilities and optimality guarantees of online planning with the inherent robustness attributed to offline learning.

研究の動機と目的

  • 純粋なモデルベース制御の限界、例えばモデル不一致や現実世界の条件下での仮定違反への感受性を解消すること。
  • ギャップやステッピングストーンのようなスパースな地形における脚付き歩行の強化学習において、報酬が疎である問題を克服すること。
  • 異なる軌道最適化手法と地形タイプにわたる一般化を可能にする統一された制御ポリシーの開発。
  • シミュレーションおよび実世界でのデプロイメントにおいて、シミュレーションから実世界へのドメインランダム化を最小限に抑えて、高精度な足場配置と頑健な回復を実現すること。

提案手法

  • モデルベースの軌道最適化アルゴリズムが、ポリシー推論中にリアルタイムで参照運動および足場を生成する。
  • シミュレーションで、最適化アルゴリズムの挙動を模倣する密度の高い報酬を用いて、深層ニューラルネットワークポリシーを最適化された足場の追従に学習させる。
  • 1200種類の区別可能な地形パッチ(12種類の地形タイプ、10段階の難易度)を含む地形カリキュラムを用いて学習させることで、広範な一般化性能を実現する。
  • 最適化アルゴリズムは、足の接触時(0.465秒ごと)にのみ更新され、計算負荷を低減し、ポリシーの「怠惰な」挙動を防ぐ。
  • ロボットが転倒した、押された、またはコマンドが変更された場合に、最適化された軌道を再計算することで、動的状況下でも有効性を保証する。
  • 訓練中に関節位置観測にノイズを注入することで、実世界での高さドリフトをシミュレートし、それを緩和する。

実験結果

リサーチクエスチョン

  • RQ1深層強化学習ポリシーは、報酬が疎であるため学習が困難なギャップやステッピングストーンのようなスパースな地形において、高精度な足場配置を達成できるか?
  • RQ2提案されたハイブリッドアーキテクチャは、純粋なモデルベース手法と比較して、滑りやすいまたは変形しやすい地面などの環境の不確実性に対して、どの程度頑健性を向上させるか?
  • RQ3訓練中に見なかった異なる軌道最適化手法に対しても、学習済みポリシーはどの程度一般化できるか?
  • RQ4シミュレーションから実世界へのドメインランダム化を最小限に抑えて高い性能を達成できるか?また、必要なトレーニングスループットはどの程度か?

主な発見

  • DTCポリシーは、1日間(6000エポック)のトレーニングでピーク性能の90%に達し、2週間(90000エポック)で完全収束する。
  • 異なる軌道最適化手法、訓練中に見なかった手法を含めても、ポリシーは一般化でき、強い転送性能を示した。
  • 滑りやすい・変形しやすい地形でも優れた頑健性を発揮し、モデルベースのベースラインを上回る失敗回復性能と安定性を達成した。
  • ギャップやステッピングストーンのようなスパースな地形でも、純粋なデータ駆動型手法が通常失敗する状況でも、高精度な足場配置を維持した。
  • 1日あたり1.6年分の最適化された軌道を生成しているにもかかわらず、トレーニングスループットはベースラインRLアプローチの1.7倍低いにとどまり、高い計算効率を示した。
  • 微調整なしに、3種類の異なるANYmalロボットバージョン(CおよびD)で50 Hzで正常にデプロイされた。シミュレーションから実世界への転送性能の高さが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。