[论文解读] Deep Actor-Critic Learning for Distributed Power Control in Wireless Mobile Networks
该论文提出了一种基于深度确定性策略梯度(DDPG)的分布式深度演员-critic强化学习框架,用于移动无线网络中的连续功率控制。通过在集中式训练中使用实时移动性和延迟/不完整信道状态信息(CSI),该方法在动态环境中实现了与集中式优化(WMMSE和FP)相当的和速率性能,同时具备可扩展性、实时性和实际部署的可行性。
Deep reinforcement learning offers a model-free alternative to supervised deep learning and classical optimization for solving the transmit power control problem in wireless networks. The multi-agent deep reinforcement learning approach considers each transmitter as an individual learning agent that determines its transmit power level by observing the local wireless environment. Following a certain policy, these agents learn to collaboratively maximize a global objective, e.g., a sum-rate utility function. This multi-agent scheme is easily scalable and practically applicable to large-scale cellular networks. In this work, we present a distributively executed continuous power control algorithm with the help of deep actor-critic learning, and more specifically, by adapting deep deterministic policy gradient. Furthermore, we integrate the proposed power control algorithm to a time-slotted system where devices are mobile and channel conditions change rapidly. We demonstrate the functionality of the proposed algorithm using simulation results.
研究动机与目标
- 解决大规模、移动性显著的蜂窝网络中快速变化的信道条件下的动态干扰管理挑战。
- 克服集中式、基于模型的优化方法(如WMMSE、FP)的局限性,这些方法需要完整的实时CSI,且易受反馈延迟影响。
- 通过数据驱动、无模型的强化学习方法,实现可扩展、分布式、实时的功率控制,适用于移动设备。
- 评估深度强化学习在延迟和不完整CSI等实际约束条件下,是否能够匹配或逼近集中式优化的性能。
提出的方法
- 采用多智能体深度强化学习框架,其中每个发射机作为独立智能体,基于本地观测学习其功率水平。
- 使用深度确定性策略梯度(DDPG)——一种适用于连续动作空间的演员-评论家算法——实现无需量化的精细功率控制。
- 采用时隙制系统,结合Haas的移动性模型,设备每秒改变位置,从而引发动态的瑞利衰落(小尺度衰落)与路径损耗(大尺度衰落)。
- 通过路径损耗和对数距离阴影衰落模型化信道条件,阴影衰落根据移动性和空间相关性动态更新。
- 使用集中式训练器对策略进行集中训练,基于和速率效用与干扰外部性计算各智能体的奖励。
- 支持分布式执行:仅将训练好的演员网络分发给各智能体,最大限度减少通信开销,实现实时适应。
实验结果
研究问题
- RQ1在移动性和不完整CSI条件下,基于分布式、无模型的深度强化学习方法能否实现与集中式优化相当的和速率性能?
- RQ2训练期间的设备移动性如何影响所学功率控制策略的收敛性和性能?
- RQ3在不重新训练的情况下,针对较小网络部署预训练的策略在更大、更复杂的网络拓扑中能实现多大程度的泛化?
- RQ4与离散动作空间方法(如DQN)相比,采用连续动作空间(通过DDPG实现)在功率控制中的性能和可扩展性方面是否具有优势?
主要发现
- 基于DDPG的策略在10小区、20链路的网络中实现了平均2.59 bps/Hz的和速率,与集中式FP算法的2.61 bps/Hz非常接近。
- 即使在存在延迟和不完整CSI的情况下,所学策略仍优于随机初始化和全功率发射,分别达到2.59 bps/Hz和0.93 bps/Hz。
- 在10小区、20链路网络上训练的策略可良好泛化至更大规模网络:在20小区、100链路网络中实现1.14 bps/Hz,接近FP算法的1.23 bps/Hz。
- 训练期间的移动性显著提升了性能:由于暴露于多样化的信道条件,策略的和速率随训练轮次持续提升。
- 该方法每时隙仅需一次策略评估,而WMMSE需42–74次迭代,FP需24次迭代,因此可实现真正的实时运行。
- 针对小规模部署预训练的策略可直接应用于大规模网络而无需重新训练,展现出强大的泛化能力与可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。