Skip to main content
QUICK REVIEW

[論文レビュー] DOB-Net: Actively Rejecting Unknown Excessive Time-Varying Disturbances

Tianming Wang, Wenjie Lu|arXiv (Cornell University)|Jul 10, 2019
Reinforcement Learning in Robotics参考文献 38被引用数 4
ひとこと要約

DOB-Net は、ロボットシステムにおける未知で時間変動的かつ過大な摂動を能動的に抑制するための強化学習フレームワークである。RNNの隠れ状態を用いて過去の摂動を符号化し、将来の摂動を予測することで、アクチュエータの制約下でも最適制御を実現する。シミュレーションおよび水中で収集された実世界の摂動を用いた実験において、従来のフィードバック制御と古典的な強化学習アルゴリズムを著しく上回る性能を発揮した。

ABSTRACT

This paper presents an observer-integrated Reinforcement Learning (RL) approach, called Disturbance OBserver Network (DOB-Net), for robots operating in environments where disturbances are unknown and time-varying, and may frequently exceed robot control capabilities. The DOB-Net integrates a disturbance dynamics observer network and a controller network. Originated from conventional DOB mechanisms, the observer is built and enhanced via Recurrent Neural Networks (RNNs), encoding estimation of past values and prediction of future values of unknown disturbances in RNN hidden state. Such encoding allows the controller generate optimal control signals to actively reject disturbances, under the constraints of robot control capabilities. The observer and the controller are jointly learned within policy optimization by advantage actor critic. Numerical simulations on position regulation tasks have demonstrated that the proposed DOB-Net significantly outperforms a conventional feedback controller and classical RL algorithms.

研究の動機と目的

  • 制御能力を超える未知で過大かつ時間変動的な摂動にさらされるロボットの制御という課題に取り組む。
  • 正確なシステムモデルに依存し、時間相関性や制御制約を無視する従来の摂動観測ベース制御(DOBC)の限界を克服する。
  • 摂動推定と制御方策の両方を統合的に最適化する学習フレームワークを構築し、より高いロバスト性と性能を実現する。
  • RNN を用いた予測的摂動符号化により、急激に変化する摂動への適応性を高める能動的摂動抑制を実現する。
  • 水中タンクで AUV から収集したデータを用いて、シミュレーテッド摂動および実世界の摂動の両方で手法を検証する。

提案手法

  • DOB-Net は、アドバンテージアクタークリティックによるポリシー最適化により、エンドツーエンドに訓練される摂動ダイナミクス観測ネットワークと制御ネットワークを統合する。
  • 観測ネットワークは、再帰的ニューラルネットワーク(RNN)を用い、過去の摂動値を符号化し、隠れ状態に将来の摂動を予測する。これは従来の DOB 機構を模倣・強化する。
  • RNN を用いた観測ネットワークは正確なシステムモデルを必要とせず、モデル不確実性に対するロバスト性を向上させる。
  • 制御信号は、現在のロボットの状態と RNN が埋め込んだ摂動予測値を入力として、制御ネットワークによって生成される。
  • 観測ネットワークと制御ネットワークの共同学習により、摂動ダイナミクスの最適な表現が可能となり、手動で設計された特徴量に依存しなくなる。
  • 学習には、複数の正弦波から構成されるシミュレーテッド摂動を使用する。テストは、シミュレーテッドおよび AUV の IMU から収集した実世界の摂動の両方で実施される。

実験結果

リサーチクエスチョン

  • RQ1RNN を強化した観測ネットワークは、過大かつ時間変動的な摂動に直面するロボットの摂動推定と予測を向上させることができるか?
  • RQ2強化学習による観測ネットワークと制御ネットワークの共同学習は、古典的なフィードバック制御や単独の強化学習手法よりも優れた摂動抑制を達成できるか?
  • RQ3訓練中に見なかった実世界の複雑で多様な摂動に対して、DOB-Net はどのように性能を発揮するか?
  • RQ4摂動がアクチュエータの能力を超えた場合、制御制約下でも性能を維持できるか?
  • RQ5限られた訓練データで、広い振幅範囲を持つ未確認の摂動パターンに対しても、フレームワークは一般化可能か?

主な発見

  • 大規模なシミュレーテッド摂動下で、DOB-Net はターゲットからの中央値距離が 0.493m にまで縮小され、従来の制御器や古典的な強化学習と比較して収束領域が著しく狭まった。
  • 大規模なシミュレーテッド摂動下で、DOB-Net と最適軌道の中央値距離比は 186.65% であった。これは理論的最適に非常に近い性能を示している。
  • 収集済みの実世界の摂動では、DOB-Net の中央値距離は最適値の 264.88% にとどまり、実データの高次元性と多様性の高さに起因する性能ギャップが確認された。
  • 実データにおけるギャップにもかかわらず、DOB-Net は RISE や DOBC を含むすべてのベースラインを上回り、実世界のシナリオにおいて実用的効果を示した。
  • より大きな摂動振幅では、最適制御パターンが類似しやすくなり、RL が近似的最適ポリシーを学習しやすくなった。これにより相対的な性能が向上した。
  • RNN が隠れ状態に時間的ダイナミクスを符号化できるため、モデル不確実性や急激に変化する摂動に対して、本手法は高いロバスト性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。