Skip to main content
QUICK REVIEW

[論文レビュー] Autonomous Blimp Control using Deep Reinforcement Learning

Yu Tang Liu, Eric Price|arXiv (Cornell University)|Sep 22, 2021
Aerospace Engineering and Energy Systems参考文献 41被引用数 8
ひとこと要約

本論文は、非線形性、時間遅れ、浮力変化といった課題に対処するため、シミュレーション内での自律的制御を可能にするQR-DQNを用いた深層強化学習(DRL)手法を提案する。この手法は、コンパクトな状態表現、滑らかな制御を実現する離散的アクション、およびノイズ拡張による耐障害性を採用し、風やパrameter不確実性下でも安定した軌道追従を達成する。

ABSTRACT

Aerial robot solutions are becoming ubiquitous for an increasing number of tasks. Among the various types of aerial robots, blimps are very well suited to perform long-duration tasks while being energy efficient, relatively silent and safe. To address the blimp navigation and control task, in our recent work, we have developed a software-in-the-loop simulation and a PID-based controller for large blimps in the presence of wind disturbance. However, blimps have a deformable structure and their dynamics are inherently non-linear and time-delayed, often resulting in large trajectory tracking errors. Moreover, the buoyancy of a blimp is constantly changing due to changes in the ambient temperature and pressure. In the present paper, we explore a deep reinforcement learning (DRL) approach to address these issues. We train only in simulation, while keeping conditions as close as possible to the real-world scenario. We derive a compact state representation to reduce the training time and a discrete action space to enforce control smoothness. Our initial results in simulation show a significant potential of DRL in solving the blimp control task and robustness against moderate wind and parameter uncertainty. Extensive experiments are presented to study the robustness of our approach. We also openly provide the source code of our approach.

研究の動機と目的

  • 従来のPID制御や非線形制御では処理が難しい飛行体の非線形性、時間遅れ、動的浮力変化の課題を解消すること。
  • シミュレーション上での深層強化学習を用いて、長時間飛行に耐えるサンプル効率的で耐障害性のある制御方策を開発すること。
  • 離散的アクション空間の設計と報酬関数へのアクションペナルティの組み込みにより、制御の滑らかさと安定性を向上させること。
  • トレーニング中にデータ拡張を実施することで、風やパrameter変動といった環境の不確実性に対する耐障害性を強化すること。
  • 現実世界への適用可能性を高めるために、現実の動的特性とセンサーノイズを再現したシミュレーション環境での完全なトレーニングを実施すること。

提案手法

  • ROSとGazeboを用いたソフトウェアインザループ(SITL)シミュレーションを活用し、飛行体の動的特性を高精度にモデル化する。
  • 次元削減を実現しつつも、制御に必要な情報を保持するコンパクトな状態表現を設計する。
  • 滑らかなアクチュエータ出力を実現するため、離散的アクション空間を採用し、急激な制御入力を防ぐ。
  • より優れた価値関数近似を実現するため、QR-DQN(Quantile Regression DQN)を採用し、安定的かつ効率的な深層強化学習を実現する。
  • 実世界のセンサーやアクチュエータの不確実性を再現するため、トレーニング中に観測値とアクションへのノイズ注入を実施する。
  • ウェイポイント到達を最優先とし、高度損失の最小化とモータ使用量の削減を目的としたスパarsely shaped報酬関数を定義する。

実験結果

リサーチクエスチョン

  • RQ1深層強化学習は、シミュレーション上での大型飛行体の非線形的かつ時間遅れのある、パrameter変動を伴う動的特性を効果的に処理できるか?
  • RQ2風の影響や浮力変化が生じる状況下で、提案手法のDRLエージェントは従来の制御器と比較してどの程度優れた性能を示すか?
  • RQ3トレーニング中にノイズを注入することで、DRL方策の実世界の不確実性に対する耐障害性はどの程度向上するか?
  • RQ4ペナルティに基づく形状付けを施した離散的アクション空間は、高次元連続制御問題において滑らかで安定した制御を達成できるか?
  • RQ5現在のDRL方策には、高度制御における限界や質量不均衡、風向きの逆転に対する感受性といった課題が存在するか?

主な発見

  • DRLエージェントは、中程度の風の影響を受ける状況下でも、シミュレーション上でウェイポイントナビゲーションタスクを安定して完了した。
  • 浮力が低下すると性能が劣化する:元の浮力の95%にまで低下すると、タスク完了時間が著しく延長され、この閾値を下回ると制御が完全に失敗する。
  • 質量不均衡が100g以内であれば方策は耐障害性を示すが、それ以上の不均衡は性能に悪影響を及ぼし、重量分布への感受性が顕著に現れる。
  • 特にホバーモードへの移行時において、ウェイポイント遷移中に許容できないほどの高度損失が観察された。これは報酬関数の形状付けを改善する必要があることを示唆している。
  • トレーニング中にノイズを注入することで、観測値およびアクションの摂動に対する耐障害性が向上し、実世界への一般化性能が向上した。
  • 現在のアプローチには、ウェイポイント付近での過剰な慎重さと、逆推進やスラスターベクトル制御の欠如による制限があり、複雑なマニューバーの性能向上に課題が残っている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。