Skip to main content
QUICK REVIEW

[論文レビュー] Deep Reinforcement Learning for Intelligent Reflecting Surface-assisted D2D Communications

Khoi Khac Nguyen, Antonino Masaracchia|arXiv (Cornell University)|Aug 6, 2021
Advanced Wireless Communication Technologies被引用数 4
ひとこと要約

本稿では、インテリジェント反射表面(IRS)における位相シフトとD2D送信機における送信電力を共同最適化するための深層強化学習(DRL)フレームワークを提案する。このフレームワークは、PPO(近接方策最適化)を用いており、IRS支援D2D通信におけるネットワーク合計スループットを顕著に向上させる。提案手法は、特に高い干渉環境およびQoS制約下でも、従来手法を上回る性能を発揮し、計算負荷が低い特徴を持つ。

ABSTRACT

In this paper, we propose a deep reinforcement learning (DRL) approach for solving the optimisation problem of the network's sum-rate in device-to-device (D2D) communications supported by an intelligent reflecting surface (IRS). The IRS is deployed to mitigate the interference and enhance the signal between the D2D transmitter and the associated D2D receiver. Our objective is to jointly optimise the transmit power at the D2D transmitter and the phase shift matrix at the IRS to maximise the network sum-rate. We formulate a Markov decision process and then propose the proximal policy optimisation for solving the maximisation game. Simulation results show impressive performance in terms of the achievable rate and processing time.

研究の動機と目的

  • インテリジェント反射表面(IRS)を活用することで、混雑したD2D通信における干渉と低いスペクトル効率の課題に対処すること。
  • D2D送信機の送信電力とIRSにおける位相シフト行列を共同最適化し、ネットワーク合計スループットを最大化すること。
  • 完全なCSIに依存する高計算複雑性を有する従来の最適化手法の限界を、深層強化学習を用いて克服すること。
  • 完全なチャネル状態情報(CSI)を必要とせず、動的なネットワーク状態に適応可能なスケーラブルでリアルタイムなリソース割り当てソリューションを設計すること。

提案手法

  • D2D-IRSシステムを段階的意思決定問題としてモデル化し、送信電力と位相シフトの共同最適化をマルコフ決定過程(MDP)として定式化する。
  • 学習の安定性とサンプル効率の向上を図るため、クリッピング補助目的関数を用いた近接方策最適化(PPO)アルゴリズムを採用する。
  • 状態観測値(例:ユーザーの位置、CSI推定値)を行動(送信電力と位相シフト)にマッピングするための深層ニューラルネットワークを政策ネットワークとして使用する。
  • 環境の報酬をネットワーク合計スループットとして定義し、エージェントがスペクトル効率を最大化するとともにQoS制約を満たすよう促進する。
  • PPOアルゴリズムにクリッピング機構を統合し、大きな方策更新を防ぎ、学習の安定性を確保する。
  • エージェントをオフラインでシミュレーテッド環境との相互作用を用いて学習させ、オンライン制御に向けたリアルタイム展開を可能にする。

実験結果

リサーチクエスチョン

  • RQ1深層強化学習は、IRS支援D2Dネットワークにおける送信電力と位相シフトの共同最適化問題を効果的に解けるか?
  • RQ2提案されたPPOベースDRL手法は、従来の最適化手法およびヒューリスティック手法と比較して、合計スループットおよび収束速度においてどのように差をつけるか?
  • RQ3不完全または部分的なチャネル状態情報下でも、DRLアプローチはどの程度の性能を維持できるか?
  • RQ4D2Dペア数やIRS要素数の増加に伴い、システム性能はどのようにスケーリングするか?
  • RQ5QoS制約がDRLベース最適化における達成可能な合計スループットに与える影響は何か?

主な発見

  • 提案されたPPOベースDRL手法は、全テスト設定において最高のネットワーク合計スループットを達成し、MPT、RPS、およびno-IRSベースラインを上回る。
  • 20個のIRS要素と5組のD2Dペアを想定した場合、MPTベースラインと比較して25–35%高い合計スループットを達成し、RPSおよびno-IRS手法と比較して50%以上も高い。
  • IRS要素数を10から40に増加させた際、提案手法の合計スループットは単調に増加し、スケーラビリティおよび干渉抑制能力を示している。
  • D2Dペア数が6を超過すると、他の手法は干渉過多により性能が劣化する一方、提案手法は合計スループットを増加し続ける。
  • 高QoS閾値(例:r_min ≥ 7)下でも、MPTは急激に性能を低下させるのに対し、提案手法は顕著な性能差を維持しており、そのロバスト性が示された。
  • 高送信電力(400 mW)下では、提案手法とベースラインとの性能差がさらに拡大し、干渉制限環境下における共同最適化の有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。