Skip to main content
QUICK REVIEW

[论文解读] Deep Reinforcement Learning based Modulation and Coding Scheme Selection in Cognitive Heterogeneous Networks

Lin Zhang, Junjie Tan|arXiv (Cornell University)|Nov 7, 2018
Cognitive Radio Networks and Spectrum Sensing参考文献 28被引用 8
一句话总结

该论文提出了一种基于深度强化学习(DRL)的调制与 coding 方案(MCS)选择算法,用于认知异构网络中的主用户,以自适应地缓解次用户因频谱感知不完善而引起的干扰。通过学习干扰模式并引入切换成本因子,DRL 代理在保持系统开销较低的同时,实现了接近最优的传输速率(达到最优值的90–100%),在静态与动态干扰场景下均优于基准算法。

ABSTRACT

We consider a cognitive heterogeneous network (HetNet), in which multiple pairs of secondary users adopt sensing-based approaches to coexist with a pair of primary users on a certain spectrum band. Due to imperfect spectrum sensing, secondary transmitters (STs) may cause interference to the primary receiver (PR) and make it difficult for the PR to select a proper modulation and/or coding scheme (MCS). To deal with this issue, we exploit deep reinforcement learning (DRL) and propose an intelligent MCS selection algorithm for the primary transmission. To reduce the system overhead caused by MCS switchings, we further introduce a switching cost factor in the proposed algorithm. Simulation results show that the primary transmission rate of the proposed algorithm without the switching cost factor is 90 percent to 100 percent of the optimal MCS selection scheme, which assumes that the interference from the STs is perfectly known at the PR as prior information, and is 30 percent to 100 percent higher than those of the benchmark algorithms. Meanwhile, the proposed algorithm with the switching cost factor can achieve a better balance between the primary transmission rate and system overheads than both the optimal algorithm and benchmark algorithms.

研究动机与目标

  • 解决认知异构网络中因频谱感知不完善导致的主用户传输性能下降问题,以及由此引发的次用户干扰问题。
  • 设计一种智能的MCS选择机制,使主用户能够在未知次发射机干扰的情况下自适应选择最优调制与编码方案。
  • 通过在强化学习框架中引入切换成本因子,平衡主用户传输速率与系统开销。
  • 在准静态与动态干扰条件下评估所提DRL算法的性能,并与最优算法及基准算法进行对比。

提出的方法

  • 在主用户接收端采用深度Q网络(DQN)作为DRL代理,以随时间学习来自次用户发射机的干扰模式。
  • 代理观测当前干扰水平,并选择MCS以最大化长期奖励,该奖励定义为传输速率与切换成本之间的权衡。
  • 在奖励函数中引入切换成本因子,以惩罚频繁的MCS切换,从而降低系统开销。
  • 使用经验回放和目标网络对DRL代理进行训练,以稳定学习过程,从过去的状态-动作-奖励转换的经验回放缓冲区中采样经验。
  • 在静态与动态干扰场景下对算法进行评估,模拟具有多个次用户对的现实认知HetNet环境。
  • 奖励函数结合瞬时传输速率与与MCS切换频率成比例的惩罚项,使代理能够在性能与开销之间实现平衡。

实验结果

研究问题

  • RQ1基于DRL的MCS选择算法能否在频谱感知不完善的认知HetNet中有效学习并适应次用户的干扰模式?
  • RQ2引入切换成本因子后,对MCS自适应中主用户传输速率与系统开销之间的权衡有何影响?
  • RQ3所提出的DRL算法在性能上与假设具备完美干扰信息的最优MCS选择方案相比如何?
  • RQ4与基准算法(如基于SNR和UCB的算法)相比,DRL算法在传输速率与切换频率方面分别实现了多大的性能提升?
  • RQ5在动态干扰条件下,DRL代理能否在传输速率与切换开销之间实现优于最优算法与现有基线的更好平衡?

主要发现

  • 所提出的DRL-based MCS选择算法实现了最优方案90–100%的传输速率,后者假设已知次用户干扰的完整信息。
  • 在无切换成本的情况下,该算法在传输速率上相比基准算法高出30–100%,展现出对干扰的强大适应能力。
  • 引入切换成本因子后,随着成本从0增加到6,MCS切换频率从约0.26降低至约0.03/帧,同时保持了较高的传输速率。
  • 在动态干扰场景下,当切换成本介于0至3.5之间时,DRL算法的收敛传输速率高于UCB算法(1.25–2 kbits/帧),且切换频率相当。
  • 当切换成本设定在3.5至6之间时,DRL算法的收敛传输速率高于UCB算法(超过2 kbits/帧),且切换频率相同(约0.03),表明在严格开销约束下性能更优。
  • 在所有切换成本水平(0.5至6)下,DRL算法在传输速率与切换频率上均优于基于SNR的算法,展现出鲁棒性与适应性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。