Skip to main content
QUICK REVIEW

[論文レビュー] Dynamic Channel Access and Power Control in Wireless Interference Networks via Multi-Agent Deep Reinforcement Learning

Ziyang Lu, Zhong Chen|arXiv (Cornell University)|Dec 24, 2021
Full-Duplex Wireless Communications被引用数 6
ひとこと要約

本稿では、無線干渉ネットワークにおける連携的動的チャネルアクセスおよびパワー制御のためのマルチエージェント深層強化学習(DRL)フレームワークを提案する。集中型学習において価値ベースのDQNおよび方策勾配法を用い、最適性能の約90%をWMMSEと全探索の組み合わせに近い水準で達成した。一方、フェデレーテッドDRLにより、通信量を抑えつつユーザーのプライバシーを保護する分散型学習が可能となり、同等の性能を達成した。

ABSTRACT

Due to the scarcity in the wireless spectrum and limited energy resources especially in mobile applications, efficient resource allocation strategies are critical in wireless networks. Motivated by the recent advances in deep reinforcement learning (DRL), we address multi-agent DRL-based joint dynamic channel access and power control in a wireless interference network. We first propose a multi-agent DRL algorithm with centralized training (DRL-CT) to tackle the joint resource allocation problem. In this case, the training is performed at the central unit (CU) and after training, the users make autonomous decisions on their transmission strategies with only local information. We demonstrate that with limited information exchange and faster convergence, DRL-CT algorithm can achieve 90% of the performance achieved by the combination of weighted minimum mean square error (WMMSE) algorithm for power control and exhaustive search for dynamic channel access. In the second part of this paper, we consider distributed multi-agent DRL scenario in which each user conducts its own training and makes its decisions individually, acting as a DRL agent. Finally, as a compromise between centralized and fully distributed scenarios, we consider federated DRL (FDRL) to approach the performance of DRL-CT with the use of a central unit in training while limiting the information exchange and preserving privacy of the users in the wireless system. Via simulation results, we show that proposed learning frameworks lead to efficient adaptive channel access and power control policies in dynamic environments.

研究の動機と目的

  • 限られたスペクトルとエネルギーを有する高密度で動的な無線干渉ネットワークにおける効率的なリソース割り当ての課題に対処すること。
  • 全システム状態を必要とする伝統的なモデルベース最適化手法の限界を克服し、ネットワークサイズの増大に伴いスケーリングが困難な問題を解消すること。
  • ユーザーが局所的な情報に基づいて自律的かつ局所的に意思決定できる、スケーラブルで適応可能な学習フレームワークを構築すること。
  • 集中型学習と完全分散型学習の妥協として、フェデレーテッドDRLを提案し、性能、通信コスト、ユーザーのプライバシーのバランスをとること。
  • チャネル状態が時間とともにゆっくりと変化するが顕著な動的環境において、性能が安定していることを実証すること。

提案手法

  • 中央集権的学習(DRL-CT)フレームワークを提案。中央ユニットが価値ベースのDQNおよび方策勾配法を用いてDRLエージェントを学習し、スルーレート最大化や比例公平性を目的とした報酬関数を設計する。
  • 各ユーザーが独立したDRLエージェントとして動作するマルチエージェントDRL設定を採用。学習後、ユーザーは局所的観測に基づいて自律的決定を下す。
  • 集中型学習の性能を模倣しつつ、情報交換を最小限に抑え、ユーザーのプライバシーを保護するフェデレーテッドDRL(FDRL)を導入する。
  • FDRLでは低精度量子化とデジタルのみの通信を用い、100イテレーションにおける集中型学習と比較して通信オーバーヘッドを約61%削減する。
  • 相関したレイリー fading データを用いた動的環境モデルを設計し、現実的でゆっくり変化するチャネル状態を再現する。
  • 状態空間にチャネル状態情報、ユーザーのアクティブ状態、電力レベルを含め、行動空間にチャネル選択および電力割り当てを含むマルコフ決定過程(MDP)の定式化を採用する。

実験結果

リサーチクエスチョン

  • RQ1全ネットワーク状態を必要としないマルチエージェントDRLフレームワークは、連携的動的チャネルアクセスおよびパワー制御において最適に近い性能を達成できるか?
  • RQ2DRLを用いた集中型学習の性能は、WMMSE や全探索といった伝統的な最適化手法と比較して、スルーレートおよび収束性においてどう異なるか?
  • RQ3無線ネットワークにおける分散型DRL学習において、性能、通信コスト、プライバシーのトレードオフはどのようなものか?
  • RQ4チャネル状態がゆっくりと変化するが顕著な動的環境で学習した場合、DRLポリシーの一般化性と適応性にどのような影響を与えるか?
  • RQ5フェデレーテッドDRLは、情報交換を削減しユーザーのデータを保護しつつ、集中型学習の性能を効果的に再現できるか?

主な発見

  • DRL-CTフレームワークは、パワー制御にWMMSE、チャネルアクセスに全探索を組み合わせた最適性能の約90%を達成した。
  • 動的チャネルアクセスに加えてパワー制御を導入することで、チャネルアクセスのみのケースと比較してスルーレート性能が顕著に向上した。
  • DRL-CTアルゴリズムは、伝統的な最適化手法よりも収束が早く、情報交換量も少なくて済むため、リアルタイム導入に適している。
  • 動的環境において、静的状態で学習したDRLエージェントも、ゆっくり変化するチャネル状態に良好に一般化でき、高い適応性を示した。
  • フェデレーテッドDRLは、100イテレーションにおける集中型学習と比較して、デジタル情報交換量を約61%削減しながらも、優れた性能を維持した。
  • DDRLは動的環境で性能が劣化する傾向にあったが、フェデレーテッド平均化によるユーザー間協調により、ポリシーの一般化性と適応性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。