Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Agent Deep Reinforcement Learning based Spectrum Allocation for D2D Underlay Communications

Zheng Li, Caili Guo|arXiv (Cornell University)|Dec 18, 2019
Advanced MIMO Systems Optimization参考文献 40被引用数 4
ひとこと要約

本稿では、D2Dアンダーレイ通信における分散スケジューリング割り当てを実現するためのマルチエージェント強化学習フレームワーク、MAACを提案する。このフレームワークは、リアルタイムのシグナリングを必要とせずにD2Dユーザー間の協調を可能にし、セルラーリンクの割り込み確率を低減するとともに、D2Dリンクの高い合計スループットを達成する。スケーラブルな変種であるNAACは、トレーニングの複雑さを低減し、優れた一般化性能を示す。

ABSTRACT

Device-to-device (D2D) communication underlay cellular networks is a promising technique to improve spectrum efficiency. In this situation, D2D transmission may cause severe interference to both the cellular and other D2D links, which imposes a great technical challenge to spectrum allocation. Existing centralized schemes require global information, which causes a large signaling overhead. While existing distributed schemes requires frequent information exchange among D2D users and cannot achieve global optimization. In this paper, a distributed spectrum allocation framework based on multi-agent deep reinforcement learning is proposed, named multi-agent actor critic (MAAC). MAAC shares global historical states, actions and policies during centralized training, requires no signal interaction during execution and utilizes cooperation among users to further optimize system performance. Moreover, in order to decrease the computing complexity of the training, we further propose the neighbor-agent actor critic (NAAC) based on the neighbor users' historical information for centralized training. The simulation results show that the proposed MAAC and NAAC can effectively reduce the outage probability of cellular links, greatly improve the sum rate of D2D links and converge quickly.

研究の動機と目的

  • D2Dアンダーレイ通信における干渉の課題に取り組む。D2Dリンクがセルラースペクトルを再利用する環境を想定する。
  • 密度が高く動的なネットワークにおいて、中央集権的アプローチ(高いシグナリングオーバーヘッド)と分散的アプローチ(頻繁な情報交換)の限界を克服する。
  • リアルタイムのシグナリングを必要とせずにD2Dユーザー間の協調を可能にする分散型スペクトル割り当てフレームワークを設計する。
  • 集中トレーニングと分散実行を組み合わせることで、高いシステム性能を維持しながらトレーニングの複雑さを低減する。
  • 動的な、ユーザーが多数存在する環境において、セルラーリンクの信頼性を確保するとともに、D2Dの合計スループットを最大化する。

提案手法

  • MAAC(マルチエージェントアクターキャリブレーション)を提案。全エージェントの歴史的状態、行動、方策を統合して、D2Dエージェント間の協調を可能にする、集中トレーニングと分散実行のフレームワーク。
  • NAAC(ネイバー・エージェント・アクターキャリブレーション)を導入。トレーニング時に固定数の隣接D2Dユーザーの歴史的データのみを用いることで、計算負荷を低減するスケーラブルな変種。
  • マルチエージェント強化学習フレームワーク内に深層Qネットワークとポリシー勾配法を統合し、最適なスペクトル割り当て方策を学習する。
  • セルラーリンクの割り込み確率とD2D合計スループットの両方をバランスさせる報酬関数を設計し、学習をシステムの目的に一致させる。
  • 全エージェントまたは隣接エージェントの歴史的データを用いて集中的に方策をトレーニングし、その後分散実行モードに展開する。
  • マルチエージェント環境におけるサンプル効率と一般化性能の向上を図るため、エージェント間でパラメータ共有メカニズムを採用する。

実験結果

リサーチクエスチョン

  • RQ1リアルタイムのグローバルシグナリングがなくても、マルチエージェント深層強化学習フレームワークは、D2Dアンダーレイ通信における干渉を効果的に低減し、スペクトル効率を向上させることができるか?
  • RQ2集中トレーニング時にグローバルな歴史的データを使用することで、分散スレーブ割り当ての性能と収束性にどのような影響を与えるか?
  • RQ3ネイバーに基づく情報集約戦略(NAAC)は、システム性能を維持しつつ、どの程度トレーニングの複雑さを低減できるか?
  • RQ4トレーニング時に考慮する隣接ユーザー数(λ)が、セルラーリンクおよびD2Dリンクの割り込み確率と合計スループットに与える影響はどの程度か?
  • RQ5提案フレームワークは、従来の中央集権的および分散的手法と比較して、セルラーリンクの信頼性とD2Dスループットのトレードオフをどのように改善できるか?

主な発見

  • MAACは、既存手法と比較して、セルラーリンクの割り込み確率を低減し、D2Dリンクの合計スループットを顕著に向上させる。
  • NAACは、λ(考慮対象の隣接ユーザー数)が十分に大きい場合、MAACと同等の性能を達成する。λ=2ではセルラーリンクの合計スループットが2 bit/s/Hz低くなるが、λが増加するにつれてMAACの性能に収束する。
  • NAACにおけるD2D合計スループットは、初期段階ではλが小さい場合にMAACを上回るが、λが増加するにつれて、セルラーリンク制約の厳密化に伴い低下する。
  • λが増加するにつれて、NAACの性能はMAACに収束する。これは、より多くの隣接ユーザーの履歴を組み込むことで、方策のロバスト性と信頼性が向上することを示している。
  • MAACおよびNAACの両方とも、高速に収束し、従来の中央集権的および分散的手法に比べてスペクトル効率と信頼性の面で優れている。
  • 提案されたフレームワークは、車両通信ネットワークを含む密度が高く動的なネットワークに適しており、低シグナリングオーバーヘッドと高いスケーラビリティを実現している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。