[论文解读] A Reinforcement Learning Approach for an IRS-assisted NOMA Network
本文提出一种基于深度确定性策略梯度(DDPG)的强化学习算法,用于在非正交多址(NOMA)下行链路网络中联合优化基站的波束成形和智能反射面(IRS)的相位移,以实现 sum rate 最大化。该方法在时变信道和固定信道场景下均表现出优异性能,优于随机波束成形和相位移策略。
This letter investigates a sum rate maximizationproblem in an intelligent reflective surface (IRS) assisted non-orthogonal multiple access (NOMA) downlink network. Specif-ically, the sum rate of all the users is maximized by jointlyoptimizing the beams at the base station and the phase shiftat the IRS. The deep reinforcement learning (DRL), which hasachieved massive successes, is applied to solve this sum ratemaximization problem. In particular, an algorithm based on thedeep deterministic policy gradient (DDPG) is proposed. Both therandom channel case and the fixed channel case are studied inthis letter. The simulation result illustrates that the DDPG basedalgorithm has the competitive performance on both case.
研究动机与目标
- 解决在非凸优化条件下,IRS 辅助的 NOMA 下行链路网络中 sum rate 最大化的挑战。
- 联合优化基站的波束成形向量与 IRS 的相位移,以提升频谱效率。
- 开发一种数据驱动的、基于学习的解决方案,以适应时变和固定无线信道。
- 克服传统凸优化方法在动态环境中效果较差的局限性。
- 展示深度强化学习在复杂无线资源分配问题中的可行性与优越性。
提出的方法
- 采用深度确定性策略梯度(DDPG)算法求解非凸的 sum rate 最大化问题。
- DDPG 智能体基于信道状态信息反馈学习选择波束成形向量与 IRS 相位移。
- 状态空间包含直达链路与反射链路的信道状态信息(CSI),动作空间包含波束成形向量与相位移值。
- 经验回放缓冲区用于存储转移样本(状态、动作、奖励、下一状态),以实现经验回放,提升训练稳定性。
- 通过软更新方式更新 Q 值网络与策略网络的目标网络,以提高学习稳定性。
- 奖励函数设计用于激励高 sum rate 与约束合规性,并对违反功率或服务质量约束的情况施加惩罚。
实验结果
研究问题
- RQ1深度强化学习能否有效优化 IRS 辅助 NOMA 网络中的波束成形与相位移?
- RQ2基于 DDPG 的算法在时变与固定信道条件下的性能如何?
- RQ3所提出的 RL 方法在 sum rate 方面是否优于随机波束成形与相位移配置?
- RQ4DDPG 智能体是否能在无需预先训练数据的情况下适应动态信道变化?
- RQ5在 RL 优化下,IRS 元素数量与发射功率对系统 sum rate 的影响如何?
主要发现
- DDPG 算法在时变与固定信道场景下均实现稳定收敛,累积奖励随训练轮次持续增加。
- 在时变信道情况下,算法表现出有效适应能力,对信道波动具有鲁棒性。
- 在固定信道情况下,奖励更加稳定,表明策略学习具有一致性。
- 随着发射功率提升与 IRS 元素数量增加,sum rate 显著提高,表明系统具备良好的可扩展性。
- 所提出的 DDPG 优化波束成形与相位移方案在 sum rate 性能上显著优于随机配置。
- 该方法无需依赖标注训练数据即可实现优异性能,凸显其在动态无线环境中的适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。