[论文解读] Deep Reinforcement Learning for Intelligent Reflecting Surface-assisted D2D Communications
该论文提出了一种基于近端策略优化(PPO)的深度强化学习(DRL)框架,用于联合优化D2D通信中智能反射面(IRS)的发射功率与相位偏移,显著提升了IRS辅助D2D通信网络的和速率。该方法在高干扰和QoS约束条件下,相较于基准方案表现出更优性能,且计算开销较低。
In this paper, we propose a deep reinforcement learning (DRL) approach for solving the optimisation problem of the network's sum-rate in device-to-device (D2D) communications supported by an intelligent reflecting surface (IRS). The IRS is deployed to mitigate the interference and enhance the signal between the D2D transmitter and the associated D2D receiver. Our objective is to jointly optimise the transmit power at the D2D transmitter and the phase shift matrix at the IRS to maximise the network sum-rate. We formulate a Markov decision process and then propose the proximal policy optimisation for solving the maximisation game. Simulation results show impressive performance in terms of the achievable rate and processing time.
研究动机与目标
- 为解决密集D2D通信中的干扰与频谱效率低下问题,利用智能反射面(IRS)。
- 联合优化D2D发射机的发射功率与IRS的相位矩阵,以最大化网络和速率。
- 通过使用深度强化学习,克服传统优化方法的局限性,如高计算复杂度和对完美信道状态信息(CSI)的依赖。
- 设计一种可扩展的、实时的资源分配方案,能够适应动态网络条件,且无需完整的信道状态信息。
提出的方法
- 将联合功率与相位偏移优化建模为马尔可夫决策过程(MDP),将D2D-IRS系统视为一个序列决策问题。
- 采用具有裁剪代理目标的近端策略优化(PPO)算法,以稳定训练过程并提高样本效率。
- 使用深度神经网络表示策略网络,将状态观测值(如用户位置、CSI估计值)映射为动作(发射功率与相位偏移)。
- 将环境奖励定义为网络和速率,以激励智能体在满足QoS约束的前提下最大化频谱效率。
- 在PPO算法中引入裁剪机制,以防止策略更新过大,确保学习过程的稳定性。
- 通过与环境的离线仿真交互训练DRL智能体,实现在线控制的实时部署。
实验结果
研究问题
- RQ1深度强化学习能否有效解决IRS辅助D2D网络中的联合功率与相位偏移优化问题?
- RQ2所提出的基于PPO的DRL方法在和速率与收敛速度方面,相较于传统优化方法与启发式方案表现如何?
- RQ3DRL方法在信道状态信息不完整或部分获取的情况下,性能维持程度如何?
- RQ4随着D2D对数与IRS单元数的增加,系统性能如何扩展?
- RQ5在使用DRL优化时,QoS约束对可实现和速率的影响如何?
主要发现
- 所提出的基于PPO的DRL方案在所有测试配置下均实现了最高的网络和速率,优于MPT、RPS和无IRS基线方案。
- 在20个IRS单元与5个D2D对的情况下,该方法相比MPT基线方案和速率提升25–35%,相比RPS与无IRS方案提升超过50%。
- 当IRS单元数从10增加到40时,所提方法的和速率单调增长,展现出良好的可扩展性与干扰抑制能力。
- 当D2D对数超过6对时,所提方法仍能保持和速率持续提升,而其他方案因干扰过载而性能下降。
- 在高QoS阈值条件下(如r_min ≥ 7),所提方法与MPT相比保持显著性能优势,而MPT性能急剧下降,凸显其鲁棒性。
- 在高发射功率(400 mW)条件下,所提方法与基线方案之间的性能差距进一步扩大,证实了在干扰受限场景下联合优化的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。