Skip to main content
QUICK REVIEW

[论文解读] Deep Reinforcement Learning Based Optimization for IRS Based UAV-NOMA Downlink Networks

Shiyu Jiao, Ximing Xie|arXiv (Cornell University)|Jun 17, 2021
Advanced Wireless Communication Technologies参考文献 17被引用 7
一句话总结

该论文提出了一种基于深度确定性策略梯度(DDPG)的算法,用于在IRS辅助的UAV-NOMA下行链路网络中联合优化功率分配、智能反射面(IRS)相位偏移和无人机(UAV)轨迹,在时变信道中显著提升了总速率,同时对系统规模变化保持鲁棒性。

ABSTRACT

This paper investigates the application of deep deterministic policy gradient (DDPG) to intelligent reflecting surface (IRS) based unmanned aerial vehicles (UAV) assisted non-orthogonal multiple access (NOMA) downlink networks. The deployment of the UAV equipped with an IRS is important, as the UAV increases the flexibility of the IRS significantly, especially for the case of users who have no line of sight (LoS) path to the base station (BS). Therefore, the aim of this letter is to maximize the sum rate by jointly optimizing the power allocation of the BS, the phase shifting of the IRS and the horizontal position of the UAV. Because the formulated problem is not convex, the DDPG algorithm is utilized to solve it. The computer simulation results are provided to show the superior performance of the proposed DDPG based algorithm.

研究动机与目标

  • 解决在时变信道下IRS辅助的UAV-NOMA下行链路网络中的非凸、高维优化问题。
  • 联合优化三个关键控制变量:基站功率分配、IRS相位偏移和UAV水平位置。
  • 开发一种基于强化学习的解决方案,避免依赖标注数据,并处理连续动作空间。
  • 在基站与用户间视 Line-of-Sight(LoS)链路受阻的场景下,提升频谱效率和系统鲁棒性。
  • 在用户数和IRS单元数变化的情况下,展示所提算法的有效性与可扩展性。

提出的方法

  • 由于DDPG算法适用于连续动作空间和函数逼近,因此被用于求解联合优化问题。
  • 状态空间包括信道状态信息(CSI)、用户位置和UAV位置;动作空间包括功率分配系数、IRS相位偏移和UAV坐标。
  • 奖励函数定义为总速率,并在违反连续干扰消除(SIC)约束时施加惩罚。
  • 采用具有独立策略网络和评论家网络的双深度Q网络架构,结合经验回放和软目标更新以提升训练稳定性。
  • 在每个时间步根据当前信道质量动态重新优化解码顺序,以确保SIC的可行性。
  • 通过与模拟无线环境的交互端到端训练算法,实现实时适应信道变化。

实验结果

研究问题

  • RQ1深度强化学习能否有效优化IRS-UAV-NOMA网络中的联合功率分配、IRS相位偏移和UAV轨迹?
  • RQ2所提出的基于DDPG的方法在总速率性能上与随机或固定配置策略相比如何?
  • RQ3所提算法在用户数和IRS单元数变化时的鲁棒性如何?
  • RQ4动态解码顺序调整对SIC成功率和系统总速率有何影响?
  • RQ5随着IRS单元数增加,总速率增益与计算复杂度之间存在何种权衡?

主要发现

  • 所提DDPG算法在总速率方面显著优于随机和优化基线配置,即使IRS单元数较少时亦然。
  • 在K=4用户时,DDPG方法在N=50个IRS单元时的性能优于随机策略在N=100个IRS单元时的性能。
  • 随着IRS单元数增加,总速率提升,但收益递减,因计算复杂度上升。
  • 该算法在用户数和IRS单元数变化时均保持稳定且收敛的性能,展现出强鲁棒性。
  • 在每个时间步动态重新优化解码顺序,确保了SIC的成功实施并提升了频谱效率。
  • 该方法在时变信道环境中有效,因其能基于实时信道反馈学习自适应动作,而无需依赖标注数据。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。