Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Agent Deep Reinforcement Learning Based Trajectory Planning for Multi-UAV Assisted Mobile Edge Computing

Liang Wang, Kezhi Wang|arXiv (Cornell University)|Sep 23, 2020
UAV Applications and Optimization参考文献 37被引用数 8
ひとこと要約

本稿では、複数UAVを用いたモバイルエッジコンピューティングにおけるトラジェクトリ計画フレームワークを、マルチエージェント深層強化学習(MADDPG)に基づいて提案し、端末ユーザー(UE)の公平性、UAVの負荷バランス、エネルギー効率を共同最適化する。3~4台のUAVを用いたシミュレーションにおいて、RANDOM や CIRCLE といったベースライン手法と比較して、優れた性能を発揮しており、公平性指数が0.9に達し、UEのエネルギー消費を低減している。

ABSTRACT

An unmanned aerial vehicle (UAV)-aided mobile edge computing (MEC) framework is proposed, where several UAVs having different trajectories fly over the target area and support the user equipments (UEs) on the ground. We aim to jointly optimize the geographical fairness among all the UEs, the fairness of each UAV' UE-load and the overall energy consumption of UEs. The above optimization problem includes both integer and continues variables and it is challenging to solve. To address the above problem, a multi-agent deep reinforcement learning based trajectory control algorithm is proposed for managing the trajectory of each UAV independently, where the popular Multi-Agent Deep Deterministic Policy Gradient (MADDPG) method is applied. Given the UAVs' trajectories, a low-complexity approach is introduced for optimizing the offloading decisions of UEs. We show that our proposed solution has considerable performance over other traditional algorithms, both in terms of the fairness for serving UEs, fairness of UE-load at each UAV and energy consumption for all the UEs.

研究の動機と目的

  • マルチUAV MECシステムにおける地上のUE間の地理的公平性、UAVの負荷公平性、全体のUEエネルギー消費を共同で最適化する課題に対処すること。
  • 混合整数および連続最適化変数を有する条件下でも、分散型で協調的な方法でUAVのトラジェクトリを管理すること。
  • UAVのトラジェクトリが決定された後、UEが低複雑性のオフロード意思決定を実行できるようにすることにより、実用的導入を可能とすること。
  • ランダム移動、円形飛行、固定パターンといった従来のトラジェクトリ戦略よりも、システム性能を向上させること。
  • MADDPGが現実世界の制約下で複雑かつ動的なUAV-UE相互作用を効果的に処理できるかどうかを実証すること。

提案手法

  • 各UAVが、統合報酬関数を最大化するように最適なトラジェクトリを個別に学習できるよう、マルチエージェント深層決定的方策勾配(MADDPG)アルゴリズムを採用する。
  • 報酬関数は、UE間の公平性、各UAVごとのUE負荷の公平性、全UEエネルギー消費の低減という3つの要素を統合して構成される。
  • UAVは、シミュレーテッド環境との連続的相互作用を通じてトラジェクトリを学習し、UEの位置を観測して効率的に多数のUEをサービス可能にするように位置を調整する。
  • トラジェクトリ最適化後、UAVの接近度とチャネル状態に基づいて、UEのオフロード意思決定を低複雑性アルゴリズムで決定する。
  • 集中学習・分散実行(CTDE)パラダイムを採用することで、協調的行動を実現しながらも、個々の制御を維持する。
  • ベースライン戦略には、MAT(提案手法)、RANDOM(UAVのランダム移動)、CIRCLE(UEクラスタの周囲をUAVが円形に飛行)が含まれる。

実験結果

リサーチクエスチョン

  • RQ1マルチエージェント深層強化学習アプローチは、マルチUAV MECシステムにおいて、地上のUE間の公平性とUAV間の負荷公平性を効果的にバランスさせることができるか?
  • RQ2提案されたMADDPGベースのトラジェクトリ制御は、固定パターンベースライン(例:CIRCLE、RANDOM)と比較して、公平性とエネルギー効率の面でどのように優れているか?
  • RQ3提案手法は、高いサービス品質を維持しつつ、全体のUEエネルギー消費をどの程度低減できるか?
  • RQ4分散型学習フレームワークは、中央集権的調整なしに協調的UAV行動を実現できるか?
  • RQ5タイムスロット(TS)数とUAV数が、提案されたトラジェクトリ計画の収束性と性能にどのように影響を与えるか?

主な発見

  • 4台のUAVを用いた場合、提案手法MATはUEサービス公平性の公平性指数が0.9を達成し、同条件でCIRCLE(0.6)やRANDOM(0.5)を顕著に上回った。
  • MATでは、1台のUAVあたりのUE負荷の公平性がほぼ1.0に達し、負荷分散が良好である一方、RANDOMではわずか0.75にとどまった。
  • MATはCIRCLEやRANDOMと比較して、全UEエネルギー消費をより効果的に低減し、優れたエネルギー効率を示した。
  • 4台のUAVを用いた場合、MATは1UEあたりの最小サービス回数を3台のときの約2.5から約6タイムスロットに向上させ、サービス信頼性が向上した。
  • MATの性能向上は、タイムスロット数が異なる場合にも一貫しており、割り当てられるTS数が増えるほど公平性とエネルギー効率が向上した。
  • ヒートマップ可視化により、MATを用いたUAVが協調的に需要の高い領域をカバーしており、重複サービスやサービス漏れを回避していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。