[论文解读] Power Allocation in Multi-User Cellular Networks: Deep Reinforcement Learning Approaches
本文提出了一种深度强化学习(DRL)方法——具体包括REINFORCE、DQN和DDPG——用于在存在小区间干扰的多用户蜂窝网络中的分布式功率分配。基于DDPG的方法在总速率、泛化能力和计算效率方面均优于基于模型的基准方法,表现出对用户密度和多普勒频移的鲁棒性。
The model-based power allocation algorithm has been investigated for decades, but it requires the mathematical models to be analytically tractable and it usually has high computational complexity. Recently, the data-driven model-free machine learning enabled approaches are being rapidly developed to obtain near-optimal performance with affordable computational complexity, and deep reinforcement learning (DRL) is regarded as of great potential for future intelligent networks. In this paper, the DRL approaches are considered for power control in multi-user wireless communication cellular networks. Considering the cross-cell cooperation, the off-line/on-line centralized training and the distributed execution, we present a mathematical analysis for the DRL-based top-level design. The concrete DRL design is further developed based on this foundation, and policy-based REINFORCE, value-based deep Q learning (DQL), actor-critic deep deterministic policy gradient (DDPG) algorithms are proposed. Simulation results show that the proposed data-driven approaches outperform the state-of-art model-based methods on sum-rate performance, with good generalization power and faster processing speed. Furthermore, the proposed DDPG outperforms the REINFORCE and DQL in terms of both sum-rate performance and robustness, and can be incorporated into existing resource allocation schemes due to its generality.
研究动机与目标
- 解决在存在小区间干扰的密集多用户蜂窝网络中的功率分配挑战。
- 克服传统基于模型的方法的局限性,例如计算复杂度高以及对解析可处理信道模型的依赖。
- 开发数据驱动、无模型的DRL解决方案,使其能够适应不同的网络条件和用户密度。
- 设计一种分布式、可扩展的DRL框架,兼容未来智能无线网络的实时部署。
提出的方法
- 将功率分配问题建模为马尔可夫决策过程(MDP),以支持强化学习。
- 实现三种DRL算法:基于策略的REINFORCE、基于价值的DQN以及适用于连续动作空间的演员-评论家DDPG。
- 设计一种分布式执行框架,其中每个接入点(AP)作为独立智能体运行,以实现可扩展性并降低延迟。
- 使用深度神经网络(DNN)近似价值函数和策略,采用ReLU激活函数,并通过矩阵运算优化并行计算。
- 采用离线和在线学习策略训练DRL智能体,以平衡探索与利用。
- 将信道状态信息(CSI)、用户位置和多普勒频移作为状态输入,以增强鲁棒性。
实验结果
研究问题
- RQ1与最先进的基于模型的方法相比,基于DRL的功率分配是否能在多用户蜂窝网络中实现更优的总速率性能?
- RQ2所提出的DRL框架在不同用户密度和多普勒频率下是否具有良好的泛化能力?
- RQ3与传统基于模型的方法(如FP和WMMSE)相比,基于DRL的算法在计算效率方面表现如何?
- RQ4在性能和鲁棒性方面,基于演员-评论家的DDPG算法为何优于基于策略和基于价值的DRL方法?
主要发现
- 基于DDPG的功率分配算法在所有评估的DRL方法中实现了最高的总速率性能,并优于基于模型的基准方法。
- 所有基于DRL的方法在不同用户密度(每小区1至8个用户)下均表现出良好泛化能力,即使在干扰增加的情况下仍保持高性能。
- DRL方法对多普勒频移变化(4 Hz至18 Hz)表现出鲁棒性,总速率仅缓慢下降,表明对快衰落具有较强耐受能力。
- 所提出的DRL算法在CPU上执行时计算时间显著降低——约为FP的15.5倍快,约为WMMSE的61.0倍快。
- 尽管在分布式环境中由于批处理受限导致GPU执行时间较高,但由于可并行化的矩阵运算和ReLU激活函数,DNN推理仍保持高效。
- DDPG算法消除了离散动作空间带来的量化误差,因此在连续功率分配任务中相比DQN和REINFORCE表现出更优性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。