Skip to main content
QUICK REVIEW

[論文レビュー] Deep Reinforcement Learning Based Multi-Access Edge Computing Schedule for Internet of Vehicle

Xiaoyu Dai, Kaoru Ota|arXiv (Cornell University)|Feb 15, 2022
IoT and Edge/Fog Computing被引用数 5
ひとこと要約

本稿では、無人航空機(UAV)支援型インターネット・オブ・ドレッド(IoV)ネットワークにおけるマルチアクセスエッジコンピューティング(MEC)スケジューリングを最適化するため、マルチエージェントグラフ畳み込み深層強化学習(M-AGCDRL)アルゴリズムを提案する。グラフアテンションネットワークを用いたマルチエージェント連携とアクター・クリティック深層強化学習を組み合わせることで、標準的なQ学習およびアクター・クリティックベースラインと比較して、収束が速く、より高い体験品質(QoE)を達成する。オフロード性能は最大20%向上し、動的なトラフィック状況下でも安定したQoSを実現する。

ABSTRACT

As intelligent transportation systems been implemented broadly and unmanned arial vehicles (UAVs) can assist terrestrial base stations acting as multi-access edge computing (MEC) to provide a better wireless network communication for Internet of Vehicles (IoVs), we propose a UAVs-assisted approach to help provide a better wireless network service retaining the maximum Quality of Experience(QoE) of the IoVs on the lane. In the paper, we present a Multi-Agent Graph Convolutional Deep Reinforcement Learning (M-AGCDRL) algorithm which combines local observations of each agent with a low-resolution global map as input to learn a policy for each agent. The agents can share their information with others in graph attention networks, resulting in an effective joint policy. Simulation results show that the M-AGCDRL method enables a better QoE of IoTs and achieves good performance.

研究の動機と目的

  • 地上基地局の容量が限られる状況下で、高移動性のIoV環境における動的で低遅延かつ高信頼性の無線通信を実現すること。
  • UAVに搭載されたMECサーバーを活用して、車両の計算オフロードを効率化し、体験品質(QoE)を向上させること。
  • 変化する車両密度および移動パターンに適応可能な、スケーラブルで分散型の複数UAV向けスケジューリングメカニズムを開発すること。
  • 高計算およびスペクトル要求が生じる密度の高いIoVシナリオにおける、単一UAVシステムおよび従来のリソース割り当ての限界を克服すること。

提案手法

  • M-AGCDRLアルゴリズムは、各UAVが局所的観測と低解像度のグローバルマップにアクセスするマルチエージェント深層強化学習フレームワークを採用する。
  • エージェント間の関係をモデル化し、情報共有を可能にするために、グラフ畳み込みネットワーク(GCNs)とグラフアテンション機構を用いる。これにより、共同政策学習が向上する。
  • ポリシーネットワークはアクター・クリティックアーキテクチャで実装され、アドバンテージベースの価値推定とポリシー勾配更新を組み合わせることで、学習の安定化と収束の向上を図る。
  • 集中学習・分散実行(CTDE)パラダイムを採用し、エージェントが協調行動を学習しつつ、推論時には独立して動作できるようにする。
  • 状態空間には、車両の位置、タスクキュー長、UAVの位置が含まれ、行動空間はタスクオフロード意思決定およびUAVの軌道調整を制御する。
  • 報酬関数は、QoE(MOSを用いてモデル化)、オフロード成功確率、エネルギー効率のバランスをとる。ハイパーパrameterはグリッドサーチにより最適化される。

実験結果

リサーチクエスチョン

  • RQ1高移動性のIoV環境において、動的かつ高スループットな通信を実現するため、複数UAVを用いたMECスケジューリングをどのように最適化できるか?
  • RQ2UAV支援型IoVネットワークにおいて、グラフベースのマルチエージェント通信を組み込むことで、独立したエージェントと比較して、協調性と性能がどの程度向上するか?
  • RQ3M-AGCDRLアルゴリズムは、合成的および実世界の交通シナリオにおいて、標準的なQ学習およびアクター・クリティックベースラインと比較して、収束速度およびオフロード性能でどの程度優れているか?
  • RQ4高密度のIoVネットワークにおいて、オフロード利得とリソースオーバーヘッドのバランスを取るために、最適なUAV数は何か?
  • RQ5UAVおよび車両の数が増加する際、システムはどのようにして安定したQoS(MOS)を維持するか?

主な発見

  • M-AGCDRLアルゴリズムは、グリッドワールドおよび実世界の札幌市交通シミュレーションの両方において、標準的なQ学習およびアクター・クリティック手法と比較して、より速い収束と高い累積報酬を達成する。
  • 提案手法は、ベースラインアルゴリズムと比較して、オフロード性能を最大20%向上させ、UAV数の増加に対しても安定的かつ高いオフロード率を維持する。
  • 10台のUAVを用いた場合、M-AGCDRL手法は約92%の安定したオフロード率を維持するが、標準的なQ学習ベースラインは78%にとどまる。
  • M-AGCDRL下での平均MOS(平均評価得点)はUAV数の増加に伴い着実に上昇し、5.0中4.6に達する。これはドライバーにとって高いQoEを示している。
  • 高い車両密度(最大100台)下でも、効果的なUAV軌道制御およびタスクスケジューリングにより、低遅延と高信頼性を維持する。
  • アルゴリズムは約1,000エピソード後に収束し、1,500エピソード以降で報酬のフラクチュエーションが顕著に減少する。これは安定したポリシー学習を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。