Skip to main content
QUICK REVIEW

[論文レビュー] Competitive MA-DRL for Transmit Power Pool Design in Semi-Grant-Free NOMA Systems.

Muhammad Fayaz, Wenqiang Yi|arXiv (Cornell University)|Jun 21, 2021
Advanced Wireless Communication Technologies参考文献 35被引用数 8
ひとこと要約

本稿では、大量のIoTネットワークにおける準ゲートフリー非直交多重アクセス(SGF-NOMA)のための動的送信電力プール(PP)を設計するために、競争的マルチエージェント深層強化学習(MA-DRL)フレームワークを提案する。リソース選択を確率的マルコフゲームとしてモデル化し、Dueling DDQNを用いて学習効率を向上させることで、純粋なゲートフリー方式に比べ22.2%高いシステムスルーレットを達成するとともに、固定電力制御に比べ17.5%の向上を実現。不正な行動のプルーニングにより訓練時間も短縮された。

ABSTRACT

In this paper, we exploit the capability of multi-agent deep reinforcement learning (MA-DRL) technique to generate a transmit power pool (PP) for Internet of things (IoT) networks with semi-grant-free non-orthogonal multiple access (SGF-NOMA). The PP is mapped with each resource block (RB) to achieve distributed transmit power control (DPC). We first formulate the resource (sub-channel and transmit power) selection problem as stochastic Markov game, and then solve it using two competitive MA-DRL algorithms, namely double deep Q network (DDQN) and Dueling DDQN. Each GF user as an agent tries to find out the optimal transmit power level and RB to form the desired PP. With the aid of dueling processes, the learning process can be enhanced by evaluating the valuable state without considering the effect of each action at each state. Therefore, DDQN is designed for communication scenarios with a small-size action-state space, while Dueling DDQN is for a large-size case. Our results show that the proposed MA-Dueling DDQN based SGF-NOMA with DPC outperforms the SGF-NOMA system with the fixed-power-control mechanism and networks with pure GF protocols with 17.5% and 22.2% gain in terms of the system throughput, respectively. Moreover, to decrease the training time, we eliminate invalid actions (high transmit power levels) to reduce the action space. We show that our proposed algorithm is computationally scalable to massive IoT networks. Finally, to control the interference and guarantee the quality-of-service requirements of grant-based users, we find the optimal number of GF users for each sub-channel.

研究の動機と目的

  • 準ゲートフリーNOMAを用いた大量IoTネットワークにおける効率的なリソース割り当ての課題に対処し、分散型送信電力制御を可能にする。
  • 品質保証(QoS)とスペクトル効率を維持する観点で、固定電力制御と純粋なゲートフリー方式の限界を克服する。
  • 大量接続とインタリーフェンス管理をサポートするスケーラブルで低遅延の電力プールメカニズムを設計する。
  • サブチャネルごとのゲートフリー利用者数を最適化し、スルーレットとゲートベース利用者のQoSの両立を図る。
  • ダウエルネットワークアーキテクチャと不正な行動の除去を活用して、マルチエージェント環境における学習効率を向上させる。

提案手法

  • ゲートフリー利用者間の相互作用をモデル化するため、共同のサブチャネルおよび送信電力選択問題を確率的マルコフゲームとして定式化する。
  • 2つの競争的MA-DRLアルゴリズム(DDQNおよびDueling DDQN)を実装し、各ゲートフリー利用者を独立したエージェントとして、自身の電力およびサブチャネル選択を最適化する。
  • 状態価値とアドバンテージ推定の分離を実現するためのダウエルネットワークを統合し、学習の安定性と収束速度を向上させる。
  • 不正または現実的でない高電力レベルを除外することで、行動空間を縮小し、訓練を高速化するとともにスケーラビリティを向上させる。
  • 得られた最適電力レベルをリソースブロックごとの送信電力プール(PP)にマッピングし、ネットワーク全体にわたる分散型電力制御を実現する。
  • 干渉を最小限に抑えつつゲートベース利用者のQoSを確保する観点から、サブチャネルごとの最適なゲートフリー利用者数を決定する。

実験結果

リサーチクエスチョン

  • RQ1マルチエージェント深層強化学習を、準ゲートフリーNOMA IoTネットワークにおける動的送信電力プール設計に効果的に適用する方法は何か?
  • RQ2標準DDQNと比較して、Dueling DDQNを用いることで、大規模な行動状態空間において学習効率とシステムスルーレットにどのような影響を与えるか?
  • RQ3不正な行動のプルーニングが、大量IoT展開における訓練時間とスケーラビリティに与える影響はどの程度か?
  • RQ4提案されたMA-DRLベースの電力プール設計は、固定電力制御および純粋なゲートフリー方式に比べ、システムスルーレットにおいてどのように差をつけるか?
  • RQ5サブチャネルごとの最適なゲートフリー利用者数は、スルーレットを最大化するとともにゲートベース利用者のQoSを維持するためのものか?

主な発見

  • 分散型電力制御を備えた提案されたMA-Dueling DDQNベースのSGF-NOMAは、純粋なゲートフリー方式に比べ22.2%高いシステムスルーレットを達成した。
  • 固定電力制御手法に比べ17.5%高いシステムスルーレットを示し、適応的電力割り当ての利点を実証した。
  • 不正な高電力行動のプルーニングにより、有効な行動空間が著しく縮小され、訓練収束が高速化され、計算スケーラビリティが向上した。
  • ダウエルアーキテクチャにより、状態価値とアドバンテージ推定の分離が実現され、特に大規模な行動状態空間において学習の安定性と性能が向上した。
  • 最適なサブチャネルごとのゲートフリー利用者数は、スペクトル効率と干渉のバランスを取るために特定され、ゲートベース利用者のQoSを確保した。
  • 全体のフレームワークは計算的にスケーラブルであり、高密度ユーザー環境を想定した大量IoTネットワークへの展開に適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。