Skip to main content
QUICK REVIEW

[論文レビュー] Simultaneous Navigation and Radio Mapping for Cellular-Connected UAV with Deep Reinforcement Learning

Yong Zeng, Xiaoli Xu|arXiv (Cornell University)|Mar 17, 2020
UAV Applications and Optimization参考文献 35被引用数 10
ひとこと要約

本論文は、セルラー接続型無人航空機(UAV)のための、シミュルティエス・ナビゲーション・アンド・ラジオマッピング(SNARM)と呼ばれる深層強化学習(DRL)ベースのフレームワークを提案する。UAVの信号測定値を活用してナビゲーション方策と予測ラジオマップを同時に学習することで、直接RLと比較して実飛行エピソードを約69%削減し、カバレッジホールを効果的に回避しながら、ミッション時間と通信障害時間の両方を最小限に抑える優れた性能を達成する。

ABSTRACT

Cellular-connected unmanned aerial vehicle (UAV) is a promising technology to unlock the full potential of UAVs in the future. However, how to achieve ubiquitous three-dimensional (3D) communication coverage for the UAVs in the sky is a new challenge. In this paper, we tackle this challenge by a new coverage-aware navigation approach, which exploits the UAV's controllable mobility to design its navigation/trajectory to avoid the cellular BSs' coverage holes while accomplishing their missions. We formulate an UAV trajectory optimization problem to minimize the weighted sum of its mission completion time and expected communication outage duration, and propose a new solution approach based on the technique of deep reinforcement learning (DRL). To further improve the performance, we propose a new framework called simultaneous navigation and radio mapping (SNARM), where the UAV's signal measurement is used not only for training the deep Q network (DQN) directly, but also to create a radio map that is able to predict the outage probabilities at all locations in the area of interest. This thus enables the generation of simulated UAV trajectories and predicting their expected returns, which are then used to further train the DQN via Dyna technique, thus greatly improving the learning efficiency.

研究の動機と目的

  • 地上の基地局配置最適化に起因する、UAVに広範な空域カバレッジが欠如している3次元セルラー通信カバレッジの非一様性という課題に対処する。
  • 簡素化・不正確な通信モデルに依存する従来の最適化ベースのUAV軌道設計の限界を克服する。
  • UAV信号測定値のみを用いて、自律的かつカバレッジに配慮したナビゲーションを可能にする、データ効率的でエンドツーエンドの学習フレームワークを開発する。
  • 学習済みラジオマップから得られるシミュレーテッド経験を訓練プロセスに統合することで、強化学習におけるサンプル効率を向上させる。
  • 複雑で現実的なラジオ環境において、ミッション目標を達成しながらカバレッジホールを回避し、通信障害時間を最小限に抑えるUAVの実現を可能にする。

提案手法

  • リアルタイムの信号測定値を直接ナビゲーション行動にマッピングするため、マルチステップ学習を組み合わせたダイング・ダブル・ディープQネットワーク(dueling DDQN)を用いた直接的DRLアプローチを提案する。
  • UAV信号測定値からラジオマップを学習し、環境全体の通信障害確率を予測する、SNARMフレームワークを導入する。
  • Dyna手法を用いて、学習済みラジオマップから合成された軌道と報酬を生成し、これを実経験に補完してDQN学習の効率を向上させる。
  • 訓練中に探索と活用のバランスを取るために、1エピソードにわたって1から10に段階的に増加するシミュレーテッドステップ数(1実ステップあたり)を採用する。
  • 価値関数とアドバンテージ関数を分離する最先端のdueling DDQNアーキテクチャを活用し、方策学習の安定性と性能を向上させる。
  • ミッション完了時間と期待される通信障害時間の両方を組み合わせた密度の高い報酬関数を用いてDQNを訓練し、信号品質が低い場合にペナルティを科す。

実験結果

リサーチクエスチョン

  • RQ1リアルタイムの信号測定値のみを用いて、事前にラジオ環境の知識がなくても、DRLベースのアプローチがカバレッジに配慮したUAVナビゲーションを効果的に学習できるか?
  • RQ2学習済みラジオマップをDRL訓練プロセスに統合することで、直接エンドツーエンドRLと比較して、サンプル効率と性能がどのように向上するか?
  • RQ3SNARMフレームワークは、効果的な方策学習を達成するために必要な実UAV飛行エピソード数をどの程度削減できるか?
  • RQ4学習済みラジオマップは、訪問していない領域の障害確率を正確に予測できるか?これにより、シミュレーテッド経験による効果的なパスプランニングが可能になるか?
  • RQ5SNARMフレームワークは、低カバレッジ地域における狭い高スループットラジオ「ブリッジ」を発見し、効果的にナビゲートできるか?

主な発見

  • SNARMは、平均報酬-1500に到達するための必要な実UAV飛行エピソード数を、直接RLの約3200から約1000にまで69%削減した。
  • 5000回の訓練エピソード後、SNARMは報酬-1486を達成したが、直接RLは-1089にとどまり、SNARMの優れた方策性能が裏付けられた。
  • 200エピソード経過後にラジオマップの平均二乗誤差(MSE)は87.1%低下し、限られたデータでも迅速な収束と高品質なマップ学習が可能であることが示された。
  • SNARMフレームワークは、狭い高スループットラジオブリッジ(例:x ≈ 1000 mおよびy ≈ 1000–1700 m付近)を効果的に特定・ナビゲートでき、環境のラジオ特徴を活用できる能力を確認した。
  • 初期段階ではマップの不正確さにより学習が遅かったが、約1000エピソードを過ぎるとSNARMは直接RLを上回る性能を示し、ラジオマップからのシミュレーテッド経験の利点が裏付けられた。
  • SNARMの移動平均報酬は、時間経過とともに安定して上昇する傾向を示し、継続的かつ効果的な方策改善が実現していることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。