[论文解读] Deep Reinforcement Learning for Multi-Agent Power Control in Heterogeneous Networks
该论文提出了一种多智能体深度强化学习(DRL)框架,称为多智能体共享评论家(MASC),用于异构网络(HetNets)中的功率控制。每个接入点(AP)作为一个独立智能体,配备本地深度神经网络(DNN)。MASC方法通过使用本地观测和共享全局评论家,实现了在线、去中心化的训练,在全局信道状态信息(CSI)获取受限且信道快速衰落的动态环境中,相较于传统的加权最小均方误差(WMMSE)和分数规划(FP)方法,实现了更高的频谱效率和更低的计算延迟。
We consider a typical heterogeneous network (HetNet), in which multiple access points (APs) are deployed to serve users by reusing the same spectrum band. Since different APs and users may cause severe interference to each other, advanced power control techniques are needed to manage the interference and enhance the sum-rate of the whole network. Conventional power control techniques first collect instantaneous global channel state information (CSI) and then calculate sub-optimal solutions. Nevertheless, it is challenging to collect instantaneous global CSI in the HetNet, in which global CSI typically changes fast. In this paper, we exploit deep reinforcement learning (DRL) to design a multi-agent power control algorithm in the HetNet. To be specific, by treating each AP as an agent with a local deep neural network (DNN), we propose a multiple-actor-shared-critic (MASC) method to train the local DNNs separately in an online trial-and-error manner. With the proposed algorithm, each AP can independently use the local DNN to control the transmit power with only local observations. Simulations results show that the proposed algorithm outperforms the conventional power control algorithms in terms of both the converged average sum-rate and the computational complexity.
研究动机与目标
- 解决HetNets中动态快速衰落无线信道带来的挑战,其中全局瞬时CSI难以获取,传统功率控制算法易过时。
- 设计一种去中心化、实时的功率控制机制,使每个AP仅使用本地信息即可优化其发射功率。
- 克服传统算法(如WMMSE和FP)在时变环境中计算延迟高且次优的问题。
- 开发一种可扩展的在线训练框架,用于多智能体DRL,实现全局性能的同时保持本地自主性。
- 证明DRL可在无需全局CSI或集中协调的情况下实现接近最优的频谱效率性能。
提出的方法
- 每个接入点(AP)被建模为一个独立智能体,其本地DNN将本地信道状态信息(CSI)映射为发射功率(动作)。
- 提出一种多智能体-共享评论家(MASC)框架,包含多个演员DNN(每个AP一个)和一个位于核心网络的共享评论家DNN。
- 共享评论家DNN基于历史全局状态转移,评估每个AP动作的全局影响,为策略学习提供集中式奖励信号。
- 每个演员DNN通过试错法,利用评论家的评估结果进行在线训练,实现去中心化但全局协调的策略优化。
- 该方法在推理阶段避免了对全局CSI的需求,并通过用快速DNN推理替代迭代优化,显著降低了计算开销。
- 框架采用深度Q学习或类似DRL算法进行端到端训练,结合经验回放和目标网络以提升稳定性。
实验结果
研究问题
- RQ1去中心化的基于DRL的功率控制框架是否能在动态HetNets中实现比WMMSE和FP等集中式算法更高的频谱效率?
- RQ2在快速衰落环境中,仅依赖本地观测与共享评论家的多智能体DRL方法,相较于依赖全局CSI的算法,性能提升程度如何?
- RQ3与WMMSE和FP等迭代优化方法相比,所提出的MASC框架在计算复杂度方面有何降低?
- RQ4在不同信道相关性和网络拓扑(如两层与三层HetNet)下,MASC方法是否仍能保持高性能?
- RQ5在仅依赖本地观测的前提下,DRL方法是否能在未见过的信道条件下实现泛化,而无需重新训练?
主要发现
- 在具有i.i.d.衰落的三层HetNet中,所提出的MASC算法在约2,500个时隙后收敛至优于WMMSE和FP算法的频谱效率性能。
- 在测试阶段,MASC算法在具有随机信道相关因子(ρ)的动态环境中,平均频谱效率高于WMMSE和FP,尤其在信道快速变化时优势更明显。
- 使用本地DNN进行功率分配的平均计算延迟仅为0.34 ms,显著低于WMMSE(120 ms)和FP(79 ms)。
- 训练评论家DNN和演员DNN的平均耗时小于10毫秒,表明其在实际网络中具备实时部署的可行性。
- 在两层HetNets中,MASC的性能优势比在三层HetNets中更为显著,原因在于拓扑复杂度增加,策略学习难度上升。
- 即使在随机信道相关(ρ)条件下,MASC框架仍能保持高性能,表明其对信道变化具有鲁棒性,且对完美全局CSI的依赖性显著降低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。