[論文レビュー] Teach Biped Robots to Walk via Gait Principles and Reinforcement Learning with Adversarial Critics
本稿では、人間の歩行原理に基づく歩行報酬と、再帰的ニューラルネットワークを組み合わせた敵対的TD3(ATD3_RNN)を提案し、二足歩行ロボットの強化学習における性能を向上させる。累積報酬推定における局所的最小値と過大評価誤差を低減することで、テスト報酬を最大23.5%向上させ、人間とロボットの歩行の類似度を69.23%向上させた。
Controlling a biped robot to walk stably is a challenging task considering its nonlinearity and hybrid dynamics. Reinforcement learning can address these issues by directly mapping the observed states to optimal actions that maximize the cumulative reward. However, the local minima caused by unsuitable rewards and the overestimation of the cumulative reward impede the maximization of the cumulative reward. To increase the cumulative reward, this paper designs a gait reward based on walking principles, which compensates the local minima for unnatural motions. Besides, an Adversarial Twin Delayed Deep Deterministic (ATD3) policy gradient algorithm with a recurrent neural network (RNN) is proposed to further boost the cumulative reward by mitigating the overestimation of the cumulative reward. Experimental results in the Roboschool Walker2d and Webots Atlas simulators indicate that the test rewards increase by 23.50% and 9.63% after adding the gait reward. The test rewards further increase by 15.96% and 12.68% after using the ATD3_RNN, and the reason may be that the ATD3_RNN decreases the error of estimating cumulative reward from 19.86% to 3.35%. Besides, the cosine kinetic similarity between the human and the biped robot trained by the gait reward and ATD3_RNN increases by over 69.23%. Consequently, the designed gait reward and ATD3_RNN boost the cumulative reward and teach biped robots to walk better.
研究の動機と目的
- エンドツーエンドの強化学習による二足歩行ロボットの不安定で不自然な歩行の課題に対処する。
- 強化学習ベースの歩行制御における報酬設計の不適切さが引き起こす局所的最小値を克服する。
- 累積報酬推定における過大評価誤差を低減し、方策学習の効率を向上させる。
- 参照軌道を用いずに、ロボットと人間の歩行パターンの運動学的類似度を向上させる。
- 生物学的力学的事前知識を深層強化学習に統合するスケーラブルでデータ駆動型の手法を開発する。
提案手法
- 人間の歩行原理に基づく歩行報酬 $ \hat{r}^g $ を設計し、不自然な運動をペナルティ化することで、局所的最小値から離れるように方策を誘導する。
- 2つの敵対的クライアントを用いることで、深層強化学習におけるQ値の過大評価を低減するATD3_RNNというアクター・クリティック手法を提案する。
- 状態・行動の時系列系列における時間的依存性をモデル化するため、クライアントに再帰的ニューラルネットワーク(RNN)を統合し、長期間にわたる責任帰属を改善する。
- 2つのクライアントのQ値を平均化することで、さらに学習の安定性を高め、過大評価バイアスを低減する。
- 歩行報酬 $ \hat{r}^g $ をデフォルトの密集報酬 $ r^d $ と組み合わせ、学習用の複合報酬信号を構築する。
- シミュレーション環境(Roboschool Walker2d および Webots Atlas)で、TD3、ATD3、ATD3_RNNの変種を用いて方策を訓練し、性能を評価する。
実験結果
リサーチクエスチョン
- RQ1人間の歩行原理に基づいて設計された報酬は、局所的最小値を低減させ、学習された二足歩行の自然さを向上させることができるか?
- RQ2標準的なTD3やDDPGと比較して、ATD3_RNNアルゴリズムは累積報酬推定における過大評価誤差をどの程度低減するか?
- RQ3クライアントにRNNを統合することで、二足歩行ロボットにおける時間的責任帰属と方策性能はどのように向上するか?
- RQ4参照軌道を用いずに、本手法はロボットと人間の歩行パターンの運動学的類似度をどの程度向上させるか?
- RQ5歩行報酬とATD3_RNNの組み合わせにより、ベースラインの強化学習手法と比較して、より高いテスト報酬とより頑健な歩行が達成できるか?
主な発見
- デフォルト報酬のみを用いた場合と比較して、歩行報酬 $ \hat{r}^g $ を用いることで、Roboschool Walker2d ではテスト報酬が23.50%向上、Webots Atlas では9.63%向上した。
- ATD3_RNNアルゴリズムを用いることで、Walker2d ではさらに15.96%、Atlas では12.68%の報酬向上が達成され、Q値推定誤差は19.86%から3.35%に低下した。
- ATD3_RNNに歩行報酬を組み合わせた場合、人間とロボットの歩行のコサイン運動学的類似度は、TD3にデフォルト報酬を用いた場合と比較して69.23%向上した。
- Walker2d ロボットでは、ATD3_RNN + $ r^d + \hat{r}^g $ を用いることで、TD3 + $ r^d $ と比較して歩行類似度が108.82%向上した。
- Atlas ロボットでは、本手法を用いることで、69.23%の歩行類似度向上が確認され、人間らしい運動生成が向上したことが示された。
- 歩行報酬とATD3_RNNの組み合わせにより、ベースラインのTD3にデフォルト報酬を用いた場合と比較して、Walker2d では43.21%、Atlas では23.53%の報酬向上が達成された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。