Skip to main content
QUICK REVIEW

[論文レビュー] Deep Reinforcement Learning Based Optimization for IRS Based UAV-NOMA Downlink Networks

Shiyu Jiao, Ximing Xie|arXiv (Cornell University)|Jun 17, 2021
Advanced Wireless Communication Technologies参考文献 17被引用数 7
ひとこと要約

本稿では、時間変動するチャネル環境下でも、ベースステーションの電力割り当て、インтелиジェント反射表面(IRS)の位相シフト、およびUAVの軌道を共同最適化するための深層決定的方策勾配(DDPG)ベースのアルゴリズムを提案する。この手法は、スケーリング変化に対してもロバストであり、ベースライン手法に比べて顕著な合計スルーレート向上を達成する。

ABSTRACT

This paper investigates the application of deep deterministic policy gradient (DDPG) to intelligent reflecting surface (IRS) based unmanned aerial vehicles (UAV) assisted non-orthogonal multiple access (NOMA) downlink networks. The deployment of the UAV equipped with an IRS is important, as the UAV increases the flexibility of the IRS significantly, especially for the case of users who have no line of sight (LoS) path to the base station (BS). Therefore, the aim of this letter is to maximize the sum rate by jointly optimizing the power allocation of the BS, the phase shifting of the IRS and the horizontal position of the UAV. Because the formulated problem is not convex, the DDPG algorithm is utilized to solve it. The computer simulation results are provided to show the superior performance of the proposed DDPG based algorithm.

研究の動機と目的

  • 時間変動するチャネルを有するIRS支援UAV-NOMAダウンリンクネットワークにおける非凸的かつ高次元の最適化問題に対処すること。
  • 基地局の電力割り当て、IRSの位相シフト、UAVの水平位置という3つの主要制御変数を共同で最適化すること。
  • 教師ありデータに依存せず、連続的アクション空間を扱える強化学習ベースのソリューションを開発すること。
  • 基地局とユーザー間のLoSリンクが遮断される状況でも、スペクトル効率とシステムのロバスト性を向上させること。
  • ユーザー数やIRS要素数の変動に対して、提案手法の有効性とスケーラビリティを実証すること。

提案手法

  • 連続的アクション空間に適していることから、共同最適化問題の解決にDDPGアルゴリズムが採用された。
  • 状態空間にはCSI、ユーザー位置、UAV位置が含まれる。アクション空間には電力割り当て係数、IRS位相シフト、UAV座標が含まれる。
  • 報酬関数は合計スルーレートとして定義され、逐次干渉キャンセレーション(SIC)制約に違反した場合にはペナルティが適用される。
  • 訓練の安定性を高めるために、別個のエージェントネットワークとクライアントネットワークを備えた二重ディープQネットワーク(DDQN)アーキテクチャを採用し、経験再生とソフトターゲット更新を組み合わせた。
  • 各タイムステップで現在のチャネル品質に基づき、デコード順序を動的に再最適化することでSICの実現可能性を保証する。
  • シミュレーテッド無線環境との相互作用を通じてエンドツーエンドで学習が行われ、チャネル変動にリアルタイムで適応可能である。

実験結果

リサーチクエスチョン

  • RQ1深層強化学習は、IRS-UAV-NOMAネットワークにおける電力割り当て、IRS位相シフト、UAV軌道の共同最適化を効果的に実行できるか?
  • RQ2提案されたDDPGベース手法は、ランダム法や固定構成法と比較して、合計スルーレート性能でどのように優れているか?
  • RQ3ユーザー数やIRS要素数の変化に対して、提案手法はどの程度ロバストであるか?
  • RQ4デコード順序の動的調整は、SICの成功確率とシステム合計スルーレートにどのような影響を与えるか?
  • RQ5IRS要素数の増加に伴い、合計スルーレート向上と計算複雑度のトレードオフはどのように変化するか?

主な発見

  • 提案されたDDPGベース手法は、ランダム法や最適化ベースのベースライン設定ですら、より顕著な合計スルーレートを達成する。特にIRS要素数が少ない場合でも同様の結果を示す。
  • K=4ユーザーの場合、N=50のIRS要素を有する最適化ケースでさえ、N=100のIRS要素を有するランダム法を上回る。
  • IRS要素数の増加に伴い合計スルーレートは上昇するが、計算複雑度の増加に伴い収益逓減の傾向を示す。
  • ユーザー数やIRS要素数の変動に対しても、安定的かつ収束性のある性能を維持しており、強いロバスト性を示している。
  • 各タイムステップでデコード順序を動的に再最適化することで、SICの実装が成功し、スペクトル効率が向上している。
  • 時間変動するチャネル環境下でも効果的であり、教師ありデータを必要とせず、リアルタイムのチャネルフィードバックに基づいて行動を適応的に学習する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。