[論文レビュー] Online Dynamics Learning for Predictive Control with an Application to Aerial Robots
本論文では、ドローンのモデル予測制御(MPC)における運用中における継続的自己最適化を可能にするオンラインダイナミクス学習フレームワーク、KNODE-MPC-Onlineを提案する。物理的知識を組み込んだニューラル常微分方程式(KNODE)モデルを、運用中に継続的に改善することで、飛行中の質量変動に対して、名目MPCと比較して軌道追従の中央値MSEを55.1%低減することに成功した。実世界のマルチローターダイナミクス実験において、優れた適応性と耐障害性を示した。
In this work, we consider the task of improving the accuracy of dynamic models for model predictive control (MPC) in an online setting. Although prediction models can be learned and applied to model-based controllers, these models are often learned offline. In this offline setting, training data is first collected and a prediction model is learned through an elaborated training procedure. However, since the model is learned offline, it does not adapt to disturbances or model errors observed during deployment. To improve the adaptiveness of the model and the controller, we propose an online dynamics learning framework that continually improves the accuracy of the dynamic model during deployment. We adopt knowledge-based neural ordinary differential equations (KNODE) as the dynamic models, and use techniques inspired by transfer learning to continually improve the model accuracy. We demonstrate the efficacy of our framework with a quadrotor, and verify the framework in both simulations and physical experiments. Results show that our approach can account for disturbances that are possibly time-varying, while maintaining good trajectory tracking performance.
研究の動機と目的
- 運用中のオンライン学習を可能にすることで、航空機におけるモデル予測制御(MPC)の適応性を向上させること。
- 実運用時に時間変動する外乱やモデル誤差に適応できない、事前学習済みモデルの限界を解消すること。
- ストリーミングセンサデータを用いて、継続的にダイナミクスモデルの精度を向上させる、データ効率的でリアルタイム対応可能なフレームワークを構築すること。
- シミュレーションおよび物理的実験の両方で、オンラインダイナミクス学習の有効性を実証すること。
- 中間飛行時の質量変動などの予期しないシステム変更に対しても、MPCコントローラーが高い軌道追従性能を維持できることを実現すること。
提案手法
- 物理的事前知識とデータ駆動型学習を統合するため、知識ベースのニューラル常微分方程式(KNODE)を用いて残差ダイナミクスをモデル化する。
- 転移学習に類似した戦略を採用し、飛行中に新たに収集されたデータを用いてKNODEモデルを段階的に更新する。
- 最近の測定値のスライディングウインドウを用いて、オンラインでダイナミクスモデルを精緻化する。ニューラルネットワークキュー長はp=3、データ収集周期はt_col=2sである。
- オンラインモデルをMPCコントローラーに統合し、加速度指令を生成する。その後、指令は下位レベルコントローラーに渡され、制御出力を生成する。
- VICONを用いた位置フィードバックと、オンボードIMUを用いた速度および加速度推定を組み合わせた階層的制御アーキテクチャを採用する。
- Crazyflieマルチローター上でフレームワークを実装し、CrazyROSを用い、400 HzでCrazyradio PAを介して通信することで、リアルタイム制御を実現した。
実験結果
リサーチクエスチョン
- RQ1オンラインダイナミクス学習は、事前学習データに存在しなかった時間変動する外乱に直面した場合、航空機におけるMPC性能を向上させることができるか?
- RQ2質量変動の下で、提案手法のオンラインKNODEベースのモデル適応は、オフライン学習およびベースラインMPCと比較して、軌道追従精度にどの程度優れているか?
- RQ3複数回の飛行実験において、オンラインフレームワークは、オフラインおよび名目制御手法と比較して、追従誤差および分散をどの程度低減できるか?
- RQ4限られたデータ量での実世界での展開において、オンライン学習フレームワークのデータ効率はどの程度か?
- RQ5外乱が特定の自由度にのみ影響する場合でも、フレームワークはすべての三次元軸(x, y, z)で一貫した性能を維持できるか?
主な発見
- KNODE-MPC-Onlineは、中間飛行時の質量変動下で、名目MPCと比較して、中央値軌道追従MSEを55.1%低減した。
- 提案手法は、オフラインKNODE-MPCベースラインと比較してMSEを21.3%低減し、未モデル化された外乱への優れた適応性を示した。
- 幾何的コントローラーと比較して、MSEで43.2%の改善を達成した。これは、複雑で時間変動するダイナミクスを効果的に処理できる能力を示している。
- 40回の実験走行において、KNODE-MPC-Onlineは追従性能の分散が低く、一貫性があり、耐障害性に優れた制御性能を示した。
- オフラインKNODE-MPCモデルは、z軸で補正を行ったものの、x軸およびy軸では性能が著しく劣り、訓練データに存在しない外乱に一般化できなかった。
- オンラインフレームワークは、すべての三次元軸で外乱に適応でき、特にオフラインモデルが失敗したxおよびy平面で顕著な優位性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。