Skip to main content
QUICK REVIEW

[論文レビュー] An Actor-Critic-Based UAV-BSs Deployment Method for Dynamic Environments

Zhiwei Chen, Yi Zhong|arXiv (Cornell University)|Feb 3, 2020
UAV Applications and Optimization参考文献 15被引用数 5
ひとこと要約

本論文は、動的環境における移動ユーザーを想定したリアルタイムなUAV搭載基地局(UAV-BS)の配置を最適化するためのアクタ・クリティック深層強化学習(DRL)手法を提案する。UAVの位置決めをマークフ・意思決定過程(MDP)としてモデル化し、2つの深層ニューラルネットワークを用いてUAVの位置を連続的に調整することで、動的ユーザー環境下でヒューリスティック手法と比較して27%高い長期平均スループットと24%短いソリューション時間の達成を実現した。

ABSTRACT

In this paper, the real-time deployment of unmanned aerial vehicles (UAVs) as flying base stations (BSs) for optimizing the throughput of mobile users is investigated for UAV networks. This problem is formulated as a time-varying mixed-integer non-convex programming (MINP) problem, which is challenging to find an optimal solution in a short time with conventional optimization techniques. Hence, we propose an actor-critic-based (AC-based) deep reinforcement learning (DRL) method to find near-optimal UAV positions at every moment. In the proposed method, the process searching for the solution iteratively at a particular moment is modeled as a Markov decision process (MDP). To handle infinite state and action spaces and improve the robustness of the decision process, two powerful neural networks (NNs) are configured to evaluate the UAV position adjustments and make decisions, respectively. Compared with the heuristic algorithm, sequential least-squares programming and fixed UAVs methods, simulation results have shown that the proposed method outperforms these three benchmarks in terms of the throughput at every moment in UAV networks.

研究の動機と目的

  • 移動ユーザーを伴う動的環境下でのリアルタイムなUAV-BS配置の課題に対処すること。
  • 時間変動する混合整数非凸プログラミング(MINP)問題を解くための従来の最適化手法の限界を克服すること。
  • 動的ユーザー移動性に応じてネットワークスループットを最大化するスケーラブルで適応可能なソリューションを開発すること。
  • MINP目的関数に基づいて数学的に根拠を持つ報酬関数を導出することで、ロバストネスと収束性を向上させること。
  • 学習された方策に基づき、UAV-BSが協調的に位置を調整し、干渉を低減できること。

提案手法

  • UAV-BS配置問題を、UAVおよびユーザーの位置を表す連続的状態空間と行動空間を持つ時間変動型マークフ意思決定過程(MDP)としてモデル化する。
  • 2つの深層ニューラルネットワークを用いたアクタ・クリティック深層強化学習フレームワークを採用し、アクター・ネットワークは行動方策を出力し、クリティック・ネットワークは状態-行動価値を評価する。
  • 報酬関数はMINP最適化目的関数から数学的に導出され、収束性とスループット最大化への整合性を保証する。
  • アクターおよびクリティック・ネットワークは、学習率0.0001、バッチ正規化を用いて過学習を防ぐAdam最適化アルゴリズムで訓練される。
  • 学習の安定化のため、バッファ容量1×10^7の経験再生を用い、ターゲットネットワークは200エポックごとに更新される。
  • 収束の加速と初期探索の改善のため、干渉なしのシステムスループットを用いた事前学習が適用される。

実験結果

リサーチクエスチョン

  • RQ1移動ユーザーの動的変化に応じて、UAV-BSをリアルタイムでどのように再配置すればスループットを最大化できるか?
  • RQ2アクタ・クリティックDRLアプローチは、ヒューリスティック手法や従来の最適化手法を上回る性能を示せるか?
  • RQ3本手法は、UAV位置決めにおける連続的かつ無限大の状態空間と行動空間をどのように処理するか?
  • RQ4数学的に導出された報酬関数は、方策収束性と性能にどのような影響を及ぼすか?
  • RQ5学習された方策は、異なるユーザー分布パターンにどの程度一般化可能か?

主な発見

  • 提案手法であるACベースのDRL手法は、ユーザーが2次元ガウス分布に従う場合、ヒューリスティックアルゴリズムと比較して27%高い長期平均スループットを達成した。
  • 均一なユーザー分布シナリオでは、ヒューリスティック手法と比較して長期平均スループットが7%向上した。
  • SLSQPベースの最適化手法と比較して、84%のタイムスロットで優れた性能を示し、優れたリアルタイム適応性を示した。
  • 本手法のソリューション時間は1439.93秒であり、ヒューリスティック手法の1916.90秒と比較して24%短縮された。
  • ユーザー密度が上昇するに従い、スループットは最大43.4%向上し、高い移動性下でも強力なスケーラビリティと性能向上を示した。
  • UAV-BSエージェントは、特にガウス分布ユーザー環境下で顕著な干渉低減が見られる協調的配置戦略を学習した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。