[论文解读] Realtime Scheduling and Power Allocation Using Deep Neural Networks
本文提出一种深度强化学习与深度神经网络(DNN)框架,以实现在密集5G小细胞网络中的实时链路调度与功率分配。深度Q网络(DQN)学习最优调度策略,而DNN则执行动态功率分配;该方法相较于使用几何规划(GP)的穷举搜索,实现了超过170,000倍的加速,性能损失低于9%。
With the increasing number of base stations (BSs) and network densification in 5G, interference management using link scheduling and power control are vital for better utilization of radio resources. However, the complexity of solving link scheduling and the power control problem grows exponentially with the number of BS. Due to high computation time, previous methods are useful for research purposes but impractical for real time usage. In this paper we propose to use deep neural networks (DNNs) to approximate optimal link scheduling and power control for the case with multiple small cells. A deep Q-network (DQN) estimates a suitable schedule, then a DNN allocates power for the corresponding schedule. Simulation results show that the proposed method achieves over five orders of magnitude speed-up with less than nine percent performance loss, making real time usage practical.
研究动机与目标
- 解决密集5G小细胞网络中实时链路调度与功率控制所面临的高计算复杂性挑战。
- 克服调度组合数量指数级增长以及使用几何规划(GP)进行穷举搜索所导致的不切实际的计算时间问题。
- 通过用基于深度学习的调度与功率分配替代穷举搜索,实现实际的实时运行。
- 在干扰约束下,通过动态加权和速率最大化(WSRMax)提升频谱效率。
- 证明深度强化学习与DNN能够以极低延迟近似接近最优解。
提出的方法
- 使用深度Q网络(DQN)基于信道状态信息与用户权重,学习在多个小细胞中选择最优上行链路/下行链路传输调度。
- 另有一个独立的DNN用于计算每个已调度链路的最优功率分配,以在干扰与功率约束下最大化加权和速率(WSR)。
- DQN通过DNN生成的WSR值进行训练,形成一种分层学习流程,其中调度依赖于精确的功率分配结果。
- 为提升准确性,从DQN中选出前五个调度方案,使用DNN进行评估,并选择最优方案——记为DQN-DNN-5。
- 该方法与基线方法进行对比,包括使用GP的穷举搜索、随机调度与使用GP的贪心调度。
- 所有模型均在用户与基站位置变化的模拟5G小细胞场景中进行训练与测试。
实验结果
研究问题
- RQ1深度Q网络(DQN)能否有效学习在干扰受限的多小区5G网络中的近似最优调度策略?
- RQ2深度神经网络(DNN)能否准确近似给定调度下的最优功率分配,实现在低延迟下的高WSR?
- RQ3用DNN-based调度与功率控制替代穷举搜索时,计算速度与性能损失之间的权衡如何?
- RQ4当与GP或DNN-based功率控制结合时,基于DQN的调度性能与贪心或随机调度相比如何?
- RQ5能否使用预训练DNN生成的WSR值有效训练DQN,从而实现调度与功率分配的端到端学习?
主要发现
- DQN-DNN-5方法相较于使用GP的穷举搜索实现了170,000倍的加速,平均运行时间从1615.34秒减少至0.0090秒。
- DQN-DNN-5方法在加权和速率(WSR)上仅产生8.66%的性能损失,相比使用GP的最优穷举搜索。
- Max-DNN方法通过DNN评估所有可能的调度方案,实现了4.5倍加速,性能损失为5.71%。
- DQN-GP方法实现了4倍加速,性能损失为6.11%,表明DQN调度的输入比随机或贪心调度所需的GP迭代次数更少(平均8.77次)。
- 使用DNN生成的WSR值训练的DQN,学会选择不仅易于用GP求解,且能实现高谱效率的调度方案。
- 仅使用DQN-DNN方法即可实现16.16%的性能损失,推理时间仅为0.0074秒,表明尽管性能损失较高,联合学习仍具实际可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。