Skip to main content
QUICK REVIEW

[论文解读] Power Allocation in Multi-user Cellular Networks With Deep Q Learning Approach

Fan Meng, Peng Chen|arXiv (Cornell University)|Dec 7, 2018
Advanced MIMO Systems Optimization参考文献 15被引用 5
一句话总结

本文提出了一种用于干扰多址接入信道(IMAC)的多用户蜂窝网络中功率分配的两步深度Q学习(DQL)框架。该方法在模拟环境中离线训练一个深度Q网络(DQN),使用当前和速率作为奖励函数,随后利用真实数据在线微调。DQN在所有测试场景中实现了最高的平均和速率,并在不同用户密度下表现出强大的泛化能力,优于如FP和WMMSE等模型驱动基准算法。

ABSTRACT

The model-driven power allocation (PA) algorithms in the wireless cellular networks with interfering multiple-access channel (IMAC) have been investigated for decades. Nowadays, the data-driven model-free machine learning-based approaches are rapidly developed in this field, and among them the deep reinforcement learning (DRL) is proved to be of great promising potential. Different from supervised learning, the DRL takes advantages of exploration and exploitation to maximize the objective function under certain constraints. In our paper, we propose a two-step training framework. First, with the off-line learning in simulated environment, a deep Q network (DQN) is trained with deep Q learning (DQL) algorithm, which is well-designed to be in consistent with this PA issue. Second, the DQN will be further fine-tuned with real data in on-line training procedure. The simulation results show that the proposed DQN achieves the highest averaged sum-rate, comparing to the ones with present DQL training. With different user densities, our DQN outperforms benchmark algorithms and thus a good generalization ability is verified.

研究动机与目标

  • 解决多用户蜂窝网络中干扰多址接入信道(IMAC)的非凸、NP难功率分配(PA)问题。
  • 克服模型驱动PA算法的局限性,如高计算复杂度和对不完美信道模型的敏感性。
  • 开发一种数据驱动、无需模型的深度强化学习(DRL)方法,可在不同用户密度和网络条件下实现良好泛化。
  • 设计一种基于DQN的框架,最大化当前和速率(无未来奖励),实现高效的实时功率控制。
  • 通过结合离线集中式训练与在线分布式执行及迁移学习,实现实际部署。

提出的方法

  • 将PA问题建模为马尔可夫决策过程(MDP),其中状态由当前信道状态信息(CSI)定义,动作为每个用户的功率水平。
  • 设计一个深度Q网络(DQN),其输入特征包含信道增益、干扰以及用户特定的功率约束,用于估计每个动作的Q值。
  • 使用基于当前和速率的奖励函数进行深度Q学习(DQL)训练,奖励函数仅依赖于当前和速率:$ R = \frac{1}{K} \text{sum} \big( \text{log}_2(1 + \text{SINR}) \big) $,不考虑未来奖励(折扣因子 $ \rho = 0 $)。
  • 实施两步训练策略:首先在模拟IMAC环境中进行离线DQN训练;其次通过迁移学习使用真实世界数据进行在线微调。
  • 使用经验回放和目标网络以稳定训练,超参数经调优以实现收敛与性能优化(如记忆大小50,000,批量大小256)。
  • 在多种网络配置下测试训练后的DQN,包括每小区用户数不同的场景(K = 1, 2, 4, 6),以分布式模式运行。

实验结果

研究问题

  • RQ1无模型深度强化学习方法是否能在多用户蜂窝网络中,于和速率与泛化能力方面超越传统模型驱动的PA算法?
  • RQ2折扣因子 $ \rho $ 的选择如何影响在仅使用当前和速率奖励函数的功率分配任务中DQN的性能?
  • RQ3在模拟环境中训练的DQN在用户分布动态变化、信道条件不断变化的真实场景中,其泛化能力有多强?
  • RQ4所提出的两步训练框架——离线仿真后接在线微调——是否能提升DQN在实际部署中的鲁棒性与性能?
  • RQ5在用户密度变化时,尤其是小区内干扰增加时,DQN的性能表现如何?

主要发现

  • 使用零折扣因子($ \rho = 0 $)训练的DQN在所有测试场景中均实现了最高的平均和速率,优于非零 $ \rho $ 的DQN,后者受延迟奖励效应影响。
  • 在所有用户密度配置(K = 1, 2, 4, 6)中,DQN均实现了最高平均和速率,即使仅在K = 4下训练,也表现出强大的泛化能力。
  • 次优方案(如随机或最大功率分配)与优化算法(FP、WMMSE、DQN)之间的性能差距随用户密度增加而扩大,表明在密集网络中智能PA带来的增益更大。
  • 在模拟中,DQN性能稳定且持续优于FP和WMMSE,在1,000个时隙内收敛平滑,波动极小。
  • DQN的推理时间随网络深度线性增长,并可通过GPU高效加速,适用于实时部署。
  • 仿真结果证实,DQN的性能不受监督学习中“教师模型”的限制,而是直接从环境反馈中学习,从而能够适应动态且未知的信道条件。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。