Skip to main content
QUICK REVIEW

[論文レビュー] Deep Actor-Critic Learning for Distributed Power Control in Wireless Mobile Networks

Yasar Sinan Nasir, Dongning Guo|arXiv (Cornell University)|Sep 14, 2020
Distributed Control Multi-Agent Systems参考文献 7被引用数 9
ひとこと要約

本稿では、移動型無線ネットワークにおける連続的パワー制御のため、Deep Deterministic Policy Gradient (DDPG) を用いた分散型ディープアクタークリティック強化学習フレームワークを提案する。リアルタイムの移動性と遅延・不完全なCSIを伴う中央集権的トレーニングにより、WMMSE や FP といった中央集権的最適化手法と同等の和レート性能を達成するとともに、動的環境におけるスケーラブルでリアルタイムかつ実用的な展開を可能にする。

ABSTRACT

Deep reinforcement learning offers a model-free alternative to supervised deep learning and classical optimization for solving the transmit power control problem in wireless networks. The multi-agent deep reinforcement learning approach considers each transmitter as an individual learning agent that determines its transmit power level by observing the local wireless environment. Following a certain policy, these agents learn to collaboratively maximize a global objective, e.g., a sum-rate utility function. This multi-agent scheme is easily scalable and practically applicable to large-scale cellular networks. In this work, we present a distributively executed continuous power control algorithm with the help of deep actor-critic learning, and more specifically, by adapting deep deterministic policy gradient. Furthermore, we integrate the proposed power control algorithm to a time-slotted system where devices are mobile and channel conditions change rapidly. We demonstrate the functionality of the proposed algorithm using simulation results.

研究の動機と目的

  • 急速に変化するチャネル状態を伴う大規模で移動性の高いセルラーネットワークにおける動的干渉管理の課題に対処すること。
  • 完全でリアルタイムのCSIを必要とし、フィードバック遅延に苦しむ、中央集権的でモデルベースの最適化(例:WMMSE, FP)の制限を克服すること。
  • モバイルデバイスに適したデータ駆動型・モデルフリーの強化学習アプローチにより、スケーラブルで分散型・リアルタイムのパワー制御を可能にすること。
  • 遅延および不完全なCSIといった実用的制約下で、ディープ強化学習が中央集権的最適化の性能を一致または近接できるかどうかを評価すること。

提案手法

  • 各送信機が局所的観測に基づいて自身のパワーレベルを学習する独立したエージェントとして機能するマルチエージェントディープ強化学習フレームワークを採用する。
  • 連続的アクション空間におけるアクタークリティック手法として、量子化なしで微細なパワー制御を可能にするDeep Deterministic Policy Gradient (DDPG) を使用する。
  • Haasの移動モデルを用いた時隙スロットシステムを実装し、デバイスが毎秒位置を変更することで、動的変化する小規模・大規模 fading を誘発する。
  • パスロスとログノーマルシャドウイングを用いてチャネル状態をモデル化し、移動性と空間相関に基づいてシャドウイングを更新する。
  • 個々のエージェントの報酬を和レートのユーティリティと干渉外部性に基づいて計算する中央集権トレーナーを用いて、ポリシーを中央でトレーニングする。
  • 分散実行を可能に:トレーニング済みのアクター・ネットワークのみをエージェントに共有することで、通信オーバーヘッドを最小限に抑え、リアルタイムの適応を実現する。

実験結果

リサーチクエスチョン

  • RQ1移動性と不完全なCSIの下で、分散型・モデルフリーのディープ強化学習アプローチは、中央集権的最適化と同等の和レート性能を達成できるか?
  • RQ2トレーニング中のデバイスの移動性が、学習済みパワー制御ポリシーの収束性および性能に与える影響はいかほどか?
  • RQ3再トレーニングなしで、小さいネットワーク展開で事前トレーニングされたポリシーが、より大規模かつ複雑なネットワークトポロジーにどの程度一般化できるか?
  • RQ4DDPGによる連続的アクション空間の使用が、DQN などの離散的アクション空間手法に比べ、パフォーマンスおよびスケーラビリティの面で優れているか?

主な発見

  • 10セル・20リンクのネットワークにおいて、DDPGベースのポリシーは1リンクあたり平均2.59 bps/Hzの和レートを達成し、中央集権的FPアルゴリズムの2.61 bps/Hzと非常に近い性能を示した。
  • 遅延および不完全なCSIでさえも、学習済みポリシーはランダムおよびフルパワー初期化を上回り、同じ条件下で2.59 bps/Hz vs. 0.93 bps/Hzを達成した。
  • 10セル・20リンクのネットワークでトレーニングされたポリシーは、大規模なネットワーク(20セル・100リンク)に対しても良好に一般化し、1.14 bps/Hzの和レートを達成した。これはFPの1.23 bps/Hzに近く、高い性能を示した。
  • トレーニング中の移動性のおかげで、ポリシーの性能が著しく向上:多様なチャネル状態にさらされたことで、エピソードを経て和レートが一貫して向上した。
  • WMMSE(42–74イテレーション)やFP(24イテレーション)とは異なり、本手法は1時隙あたり1回のポリシー評価で十分であり、リアルタイム動作が可能である。
  • 小さな展開で事前トレーニングされたポリシーを、再トレーニングなしに大規模なネットワークに直接適用可能であり、優れた一般化性とスケーラビリティを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。