Skip to main content
QUICK REVIEW

[論文レビュー] Flight Controller Synthesis Via Deep Reinforcement Learning

William R. Koch|arXiv (Cornell University)|Sep 14, 2019
Reinforcement Learning in Robotics参考文献 67被引用数 15
ひとこと要約

本論文は、アイトレイク制御と正確なエアロバティクスにおいて、従来の制御手法を上回る性能を発揮する、深層強化学習(DRL)に基づく神経飛行コントローラーの合成フレームワークを提案する。GymFC を導入してマルチコプターのデジタルツインをシミュレートし、実用的なマイコンに学習済みニューラルネットワークをデプロイ可能なオープンソースファームウェアである Neuroflight を開発した。これにより、エンドツーエンドのトレーニングからデプロイまでのパイプラインで安定した実世界飛行を実現した。

ABSTRACT

Traditional control methods are inadequate in many deployment settings involving control of Cyber-Physical Systems (CPS). In such settings, CPS controllers must operate and respond to unpredictable interactions, conditions, or failure modes. Dealing with such unpredictability requires the use of executive and cognitive control functions that allow for planning and reasoning. Motivated by the sport of drone racing, this dissertation addresses these concerns for state-of-the-art flight control by investigating the use of deep neural networks to bring essential elements of higher-level cognition for constructing low level flight controllers. This thesis reports on the development and release of an open source, full solution stack for building neuro-flight controllers. This stack consists of the methodology for constructing a multicopter digital twin for synthesize the flight controller unique to a specific aircraft, a tuning framework for implementing training environments (GymFC), and a firmware for the world's first neural network supported flight controller (Neuroflight). GymFC's novel approach fuses together the digital twinning paradigm for flight control training to provide seamless transfer to hardware. Additionally, this thesis examines alternative reward system functions as well as changes to the software environment to bridge the gap between the simulation and real world deployment environments. Work summarized in this thesis demonstrates that reinforcement learning is able to be leveraged for training neural network controllers capable, not only of maintaining stable flight, but also precision aerobatic maneuvers in real world settings. As such, this work provides a foundation for developing the next generation of flight control systems.

研究の動機と目的

  • 自律飛行を含むサイバーフィジカルシステム(CPS)における予測不能なダイナミクスや故障モードに対処する従来の制御手法の限界を克服すること。
  • 強化学習を用いて、深層ニューラルネットワークベースの飛行コントローラーをトレーニングおよびデプロイするためのスケーラブルでエンドツーエンドのソリューションを構築すること。
  • 高精度なデジタルツインと最適化されたコンパイルツールチェーンを通じて、シミュレーションから実世界のハードウェアへのスムーズな移行を実現すること。
  • 研究者や開発者にとって神経飛行コントローラー開発へのアクセスを民主化するため、オープンソーススタック(GymFC と Neuroflight)を提供すること。
  • 報酬関数の最適化と環境ダイナミクス(風やモーターの非線形性など)の強化を通じて、シミュレーションから実世界へのギャップを縮小すること。

提案手法

  • GymFC を用いたシミュレーション環境を設計し、デジタルツインモデリングと飛行制御トレーニングを統合したモジュラー強化学習フレームワークを活用して、正確なハードウェア移行を実現する。
  • 推力、トルク、重力、風などの外部干渉をモデル化するマルチコプターのデジタルツインを実装し、シミュレーションのリアリズムを向上させる。
  • アイトレイク安定性と正確なマニューバーを重視するカスタム報酬関数を用いて、深層強化学習(DRL)により深層ニューラルネットワークをトレーニングする。
  • Neuroflight ファームウェアを介して、リソース制約のあるマイコンに最適化されたAOTコンパイルコードにトレーニング済みニューラルネットワークをコンパイルするカスタムツールチェーンを実装する。
  • ハードウェアインザループ(HITL)検証を実施し、コンパイル済みモデルを市販のフライトコントローラーにフラッシュして、実世界での飛行テストを実施する。
  • ReLU活性化関数の導入や、バウンデッド分布(例:ベータ関数)の検討など、アーキテクチャの改善を実施し、安定性の向上と推論遅延の低減を図る。

実験結果

リサーチクエスチョン

  • RQ1深層強化学習は、アイトレイク制御およびエアロバティクスの正確性において、従来のPIDベースのコントローラーを上回る神経飛行コントローラーを生成できるか?
  • RQ2デジタルツインは、モーターの非線形性や環境的干渉を含む実世界のダイナミクスをどれほど正確にモデル化できるか? これにより、信頼性の高いシミュレーションから実世界への移行が可能になるか?
  • RQ3シミュレーション、トレーニング、コンパイル、ファームウェアを統合したフルスタックのオープンソースソリューションをどのように設計すれば、市販ハードウェア上でのエンドツーエンドの神経飛行コントローラーのデプロイを可能にできるか?
  • RQ4シミュレーションと実世界のドメインギャップを最小限に抑えるために、どの報酬形状化戦略と環境モデリング戦略が最も効果的か?
  • RQ5メモリや計算能力に制限のあるマイコンに複雑なニューラルネットワークを効率的にデプロイするには、どのようなアーキテクチャ的およびコンパイル最適化が必要か?

主な発見

  • 深層強化学習でトレーニングされたニューラルネットワークコントローラーは、シミュレーションおよび実世界飛行の両方で、商用のPIDベースの飛行コントローラーを上回る高いアイトレイク制御精度を達成した。
  • GymFC フレームワークは、シミュレーションから実ハードウェアへのポリシー移行をスムーズに実現し、市販のクアッドコプターでも安定した飛行性能を示した。
  • Neuroflight ファームウェアと関連するツールチェーンにより、マイコン上でAOTコンパイルされた推論が可能になり、低遅延でリアルタイム実行が達成された。
  • モーターの非線形ダイナミクス、風の影響、バッテリー放電特性のモデル化により、シミュレーションの忠実度が著しく向上し、シミュレーションと実世界の性能ギャップが縮小された。
  • 報酬関数の設計、特に正確なマニューバーを重視する目的関数の組み込みが、複雑なエアロバティクスマニューバーを実行可能なコントローラーのトレーニングに不可欠であった。
  • 今後の課題として、オンライン段階的学習と動的デジタルツインの同期化が、実世界での継続的適応性と長期的ロバストネスに不可欠であると特定された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。