Skip to main content
QUICK REVIEW

[论文解读] UAV-Aided Cellular Communications with Deep Reinforcement Learning Against Jamming

Xiaozhen Lu, Liang Xiao|arXiv (Cornell University)|May 17, 2018
UAV Applications and Optimization参考文献 15被引用 17
一句话总结

本文提出了一种基于深度强化学习(DRL)的无人机中继方案,可在无需了解干扰或网络模型的情况下,优化蜂窝网络中智能干扰下的中继功率。通过利用深度Q网络(DQN)、经验回放和迁移学习,无人机加速了学习过程,与先前方法相比,误比特率(BER)降低高达99.7%,能耗减少33.6%,在动态环境中实现了鲁棒的抗干扰性能。

ABSTRACT

Cellular systems are vulnerable to jamming attacks, especially smart jammers that choose their jamming policies such as the jamming channel frequencies and power based on the ongoing communication policies and network states. In this article, we present an unmanned aerial vehicle (UAV) aided cellular communication framework against jamming. In this scheme, UAVs use reinforcement learning methods to choose the relay policy for mobile users in cellular systems, if the serving base station is heavily jammed. More specifically, we propose a deep reinforcement learning based UAV relay scheme to help cellular systems resist smart jamming without being aware of the jamming model and the network model in the dynamic game based on the previous anti-jamming relay experiences and the observed current network status. This scheme can achieve the optimal performance after enough interactions with the jammer. Simulation results show that this scheme can reduce the bit error rate of the messages and save energy for the cellular system compared with the existing scheme.

研究动机与目标

  • 解决蜂窝系统在智能干扰攻击下的脆弱性,此类攻击利用动态网络状态和自适应干扰策略。
  • 设计一种无人机辅助中继系统,实现实时动态环境中在未知干扰和网络模型下的有效运行。
  • 通过用深度强化学习和迁移学习替代传统Q-learning,减少抗干扰中继选择中的学习时间和能耗。
  • 提高系统对实际无人机辅助蜂窝网络中常见的状态估计误差和延迟的鲁棒性。

提出的方法

  • 无人机使用带有卷积神经网络(CNN)的深度Q网络(DQN),以压缩包括误比特率(BER)、信道增益和干扰功率在内的高维状态空间。
  • 采用经验回放机制,通过存储并重用过去的状态-动作-奖励转换,以稳定训练过程并提高样本效率。
  • 通过使用类似场景下的先前抗干扰中继经验初始化CNN权重,实现迁移学习,从而加速收敛并减少高风险探索。
  • 基于DQN输出的Q值选择中继功率,以最大化无人机效用,同时最小化误比特率(BER)和能耗。
  • 系统将中继决策建模为马尔可夫决策过程(MDP),将无人机与干扰器之间的交互建模为动态博弈。
  • 在静态、反应式和智能干扰器下对方案进行评估,其中干扰器使用强化学习以低干扰成本最小化无人机效用。

实验结果

研究问题

  • RQ1基于深度强化学习的无人机中继方案是否能在不预先了解干扰或网络模型的情况下实现最优中继功率选择?
  • RQ2迁移学习如何提升动态抗干扰中继博弈中的学习速度并降低能耗?
  • RQ3与HPUR和Q-learning等现有方案相比,该方案在误比特率和能效方面有何性能提升?
  • RQ4该方案在实际无人机辅助蜂窝系统中对状态估计延迟和误差的鲁棒性如何?

主要发现

  • 与基于Q-learning的中继算法相比,所提出的DRLUR方案在第1000个时隙将用户消息的误比特率(BER)降低了99.7%。
  • 与HPUR基准相比,该方案使蜂窝系统能耗降低了33.6%,在第1500个时隙能耗减少24.6%。
  • 在长时间动态中继博弈中,DRLUR收敛至理论博弈模型的纳什均衡,表明其具有稳定最优性能。
  • 学习时间减少了84.6%——DRLUR在约200个时隙(0.22秒)内完成中继功率优化,远短于HPUR所需时间。
  • 该方案对状态估计延迟和误差的敏感性较低,在存在高斯分布估计误差(σ = 1.5)时仍能保持低误比特率。
  • 误比特率性能边界通过理论推导并经仿真验证,证实了该方案在不同干扰条件下的可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。