Skip to main content
QUICK REVIEW

[論文レビュー] Joint Trajectory and Passive Beamforming Design for Intelligent Reflecting Surface-Aided UAV Communications: A Deep Reinforcement Learning Approach

Liang Wang, Kezhi Wang|arXiv (Cornell University)|Jul 16, 2020
Advanced Wireless Communication Technologies被引用数 12
ひとこと要約

本稿では、エネルギー効率を最大化するため、IRS支援UAV通信におけるUAV軌道とパassingビームフォーミングの共同最適化を目的とした深層強化学習(DRL)ベースの手法を提案する。離散的軌道制御にはDQNに基づく手法、連続的軌道最適化にはDDPGに基づく手法を導入し、従来のFFおよびRRベンチマークと比較して高いエネルギー効率を達成した。

ABSTRACT

In this paper, the intelligent reflecting surface (IRS)-aided unmanned aerial vehicle (UAV) communication system is studied, where the UAV is deployed to serve the user equipment (UE) with the assistance of multiple IRSs mounted on several buildings to enhance the communication quality between UAV and UE. We aim to maximize the energy efficiency of the system, including the data rate of UE and the energy consumption of UAV via jointly optimizing the UAV's trajectory and the phase shifts of reflecting elements of IRS, when the UE moves and the selection of IRSs is considered for the energy saving purpose. Since the system is complex and the environment is dynamic, it is challenging to derive low-complexity algorithms by using conventional optimization methods. To address this issue, we first propose a deep Q-network (DQN)-based algorithm by discretizing the trajectory, which has the advantage of training time. Furthermore, we propose a deep deterministic policy gradient (DDPG)-based algorithm to tackle the case with continuous trajectory for achieving better performance. The experimental results show that the proposed algorithms achieve considerable performance compared to other traditional solutions.

研究の動機と目的

  • 移動するUEと動的IRS選択を伴うIRS支援UAV通信システムにおけるエネルギー効率の最大化という課題に対処すること。
  • 移動するUEと複数のIRSを有する動的で高次元な環境における従来の最適化の複雑さを克服すること。
  • 実用的制約下でのUAV軌道とパassing位相シフトの共同最適化に向けた低複雑度で適応性のあるアルゴリズムを設計すること。
  • 深層強化学習を用いてUAV移動制御とIRS反射ビームのリアルタイムかつスケーラブルな制御を可能にすること。
  • 動的ユーザー移動性とIRS選択をサポートしながら、データレートとエネルギー消費の観点からシステム性能を向上させること。

提案手法

  • UAV軌道とIRS位相シフトを行動とするマルコフ決定過程(MDP)として、共同最適化問題を定式化する。
  • 高速な学習と低複雑度を実現するため、離散化されたUAV軌道と行動空間を用いたDQNベースのアルゴリズムを実装する。
  • より高い性能を実現するため、UAV軌道と位相シフトの連続的最適化を可能にするDDPGベースのアルゴリズムを開発する。
  • データレートとUAVのエネルギー消費のバランスを取る報酬関数を用い、性能が悪い場合(例:範囲外へ移動)には負の報酬を付与する。
  • 学習の安定化と収束性の向上を図るため、経験リプレイとターゲットネットワークを用いてDQNおよびDDPGエージェントを訓練する。
  • Q値の近似(DQN)と方策関数の近似(DDPG)に全結合ニューラルネットワークを適用し、各タイムスロットごとに位相シフト最適化を実施する。

実験結果

リサーチクエスチョン

  • RQ1動的で移動するUE環境下において、UAV軌道とIRSパassingビームフォーミングをどのように共同最適化することで、システムのエネルギー効率を最大化できるか?
  • RQ2IRS支援UAV通信において、DRLベースの手法が従来のヒューリスティック的手法や最適化ベースの手法に比べて、どの程度の性能向上を達成できるか?
  • RQ3反射素子の数が、提案されたDRLアルゴリズムの学習性能とエネルギー効率にどのように影響するか?
  • RQ4DQN(離散的)とDDPG(連続的)アプローチの間で、トレーニング時間と性能のトレードオフはどのように変化するか?
  • RQ5アクティブなIRSの選択が、システムのエネルギー効率と学習収束に与える影響は何か?

主な発見

  • DDPGベースのアルゴリズムは、DQN(わずかに70 bps/J未満)よりも高い平均エネルギー効率(70 bps/J)を達成し、FFおよびRRベンチマークを顕著に上回った。
  • 反射素子の数が増加するにつれて、DQNおよびDDPGの両者とも平均報酬とエネルギー効率が向上し、IRSサイズの拡大に伴うスケーラビリティが裏付けられた。
  • DDPGは連続的行動空間最適化により、DQNよりも高い報酬を安定して達成しており、滑らかでより効果的なUAV軌道計画を可能にした。
  • 反射素子の数が増えるとトレーニング時間が延長されるが、DQNは離散的行動空間の単純さからDDPGよりも高速に学習した。
  • DDPGが学習したUAV軌道はより適応的で効率的であり、選択されたIRSおよび移動中のUEと常にLine-of-Sight(LoS)リンクを維持するように、高度と位置を動的に調整した。
  • DQNおよびDDPGエージェントは十分なトレーニングを経て安定した方策に収束し、報酬の平均値がエピソードに伴い増加し、高い水準で安定した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。