Skip to main content
QUICK REVIEW

[論文レビュー] Distributed Uplink Beamforming in Cell-Free Networks Using Deep Reinforcement Learning

Firas Fredj, Yasser Al-Eryani|arXiv (Cornell University)|Jun 26, 2020
Advanced MIMO Systems Optimization被引用数 6
ひとこと要約

本稿では、計算複雑性を低減しつつ高い性能を維持するため、セルフリーネットワークにおけるディープレインフォースメントラーニング(DRL)ベースの分散型アップリンクビームフォーミングを提案する。中央集権的なDDPG手法を導入し、D4PGを用いた分散型経験リプレイで強化することで、完全分散型DRLより高速な収束と優れたスケーラビリティを達成し、すべてのネットワークサイズにおいて線形ビームフォーミング手法を上回る性能を発揮する。

ABSTRACT

The emergence of new wireless technologies together with the requirement of massive connectivity results in several technical issues such as excessive interference, high computational demand for signal processing, and lengthy processing delays. In this work, we propose several beamforming techniques for an uplink cell-free network with centralized, semi-distributed, and fully distributed processing, all based on deep reinforcement learning (DRL). First, we propose a fully centralized beamforming method that uses the deep deterministic policy gradient algorithm (DDPG) with continuous space. We then enhance this method by enabling distributed experience at access points (AP). Indeed, we develop a beamforming scheme that uses the distributed distributional deterministic policy gradients algorithm (D4PG) with the APs representing the distributed agents. Finally, to decrease the computational complexity, we propose a fully distributed beamforming scheme that divides the beamforming computations among APs. The results show that the D4PG scheme with distributed experience achieves the best performance irrespective of the network size. Furthermore, the proposed distributed beamforming technique performs better than the DDPG algorithm with centralized learning only for small-scale networks. The performance superiority of the DDPG model becomes more evident as the number of APs and/or users increases. Moreover, during the operation stage, all DRL models demonstrate a significantly shorter processing time than that of the conventional gradient descent (GD) solution.

研究の動機と目的

  • 大規模なアクセスポイント(AP)およびユーザー設備(UE)を有するセルフリーネットワークにおける集中型ビームフォーミングの高い計算複雑性に対処すること。
  • 地理的に分散されたAPにビームフォーミング計算を分散させることで、中央処理ユニット(CPU)の信号処理負荷を低減すること。
  • 動的無線環境における効率的でスケーラブルかつ低遅延なアップリンク伝送を可能にするDRLベースのビームフォーミングフレームワークの開発。
  • 性能と収束を評価するため、提案されたDRLスキームを従来の線形ビームフォーミング技術(MMSEおよび共役ビームフォーミング)と比較すること。
  • 集中型と分散型DRL学習アーキテクチャにおける性能と計算複雑性のトレードオフを調査すること。

提案手法

  • セルフリーネットワークにおける連続的アクション空間を有するアップリンクビームフォーミング最適化のため、集中型DDPGベースのDRLフレームワークを提案する。
  • 複数のAPから得られる分散経験を活用することで収束性と性能を向上させる、分散型分布的決定的方策勾配(D4PG)アルゴリズムを用いてDDPGモデルを強化する。
  • ビームフォーミング計算を個々のAPにオフロードすることで、CPU負荷を低減し、スケーラブルな展開を可能にする完全分散型DRLビームフォーミングスキームを導入する。
  • 報酬関数としてスルーレットスペクトル効率の合計を用い、経験リプレイとターゲットネットワークを用いて方策勾配を更新する。
  • DRLエージェントへの状態入力として正確な状態を提供するため、MMSEベースのパイロット検出を用いたチャネル状態情報(CSI)推定を採用する。
  • 大規模なCSI実現値を用いてDRLモデルをオフラインで学習させ、オンライン運用時の高速推論を可能にする。

実験結果

リサーチクエスチョン

  • RQ1DRLベースのビームフォーミングは、セルフリーネットワークのアップリンク環境において、従来の線形ビームフォーミング手法(MMSEおよび共役ビームフォーミング)を上回ることができるか?
  • RQ2さまざまなネットワークサイズにおいて、集中型DDPGと分散型D4PGの収束速度およびスペクトル効率の観点での性能比較は?
  • RQ3AP間での学習プロセスの分散化が、中央プロセッサにおける計算負荷をどの程度低減できるか、かつシステム性能を維持できるか?
  • RQ4APおよびUEの数が増加するに従い、DRLベースのビームフォーミングスキームは従来手法と比較してどの程度スケーリング可能か?
  • RQ5勾配上昇などの反復的最適化手法と比較して、学習済みDRLモデルの推論遅延はどの程度か?

主な発見

  • D4PGベースの分散学習スキームは、テストされたすべてのネットワークサイズで最良の性能を達成し、MMSEおよび共役ビームフォーミング手法を上回る。
  • D4PGモデルは勾配上昇法よりも著しく高速に収束し、ネットワークサイズにかかわらず推論時間が1秒未塔である。
  • 大規模ネットワークでは集中型DDPGモデルが分散型D4PGモデルを上回る性能を示し、性能と複雑性のトレードオフを明らかにする。
  • 完全分散型DRLスキームはCPU複雑性を低減するが、小規模ネットワークでのみDDPGの性能を達成し、APおよびUE数の増加に伴い性能差が拡大する。
  • DRLベースの手法は最小限の推論遅延でほぼ最適なスペクトル効率を達成でき、動的B5Gネットワークにおける実用的展開に適している。
  • DRLモデルはさまざまなCSI実現値にわたって良好に一般化され、多様なチャネル状態で学習後に安定した性能を維持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。