Skip to main content
QUICK REVIEW

[论文解读] Deep Reinforcement Learning for Distributed Uncoordinated Cognitive Radios Resource Allocation

Ankita Tondwalkar, Dr Andres Kwasinski|arXiv (Cornell University)|Oct 29, 2019
Cognitive Radio Networks and Spectrum Sensing被引用 6
一句话总结

该论文提出了一种新颖的多智能体深度Q学习(DQL)算法,用于在非平稳环境下运行的分布式、非协调认知无线电网络,采用下行动态频谱接入模式。通过使用集中式训练、经验回放和目标网络更新,该算法在标准单智能体DQL失效的非平稳环境中实现了最优功率分配策略的收敛,展示了接近最优的性能(在有限学习时间内与穷举搜索相比仅差3%),并在69%的情况下达到了最优策略。

ABSTRACT

This paper presents a novel deep reinforcement learning-based resource allocation technique for the multi-agent environment presented by a cognitive radio network that coexists through underlay dynamic spectrum access (DSA) with a primary network. The resource allocation technique presented in this work is distributed, not requiring coordination with other agents. The presented algorithm is the first deep reinforcement learning technique for which convergence to equilibrium policies can be shown in the non-stationary multi-agent environment that results from the uncoordinated dynamic interaction between radios through the shared wireless environment. Moreover, simulation results show that in a finite learning time the presented technique is able to find policies that yield performance within 3 % of an exhaustive search solution, finding the optimal policy in nearly 70 % of cases. Moreover, it is shown that standard single-agent deep reinforcement learning may not achieve convergence when used in a non-coordinated, coupled multi-radio scenario.

研究动机与目标

  • 解决非平稳、多智能体强化学习在非协调认知无线电网络中的挑战,其中认知无线电与主网络共享频谱。
  • 开发一种分布式、无需协调的资源分配机制,使认知无线电能够自主学习最优发射功率水平。
  • 证明在弱循环随机动态博弈(一类此前无已知收敛DQL解的难题)中可收敛至均衡策略。
  • 评估标准单智能体DQL在非协调、耦合多无线接口场景中因环境非平稳性和噪声Q值估计而失效的原因。
  • 与穷举搜索进行性能基准对比,并评估在真实非协调奖励函数下的鲁棒性。

提出的方法

  • 采用集中式训练结合经验回放和目标网络更新的多智能体DQL方法,即使在非平稳环境下也能实现稳定学习。
  • 使用共享经验回放缓冲区存储所有认知无线电的转移数据,使网络能够从集体交互中学习。
  • 采用带有经验回放和目标网络的深度Q网络(DQN),以近似每个认知无线电动作选择的Q值函数。
  • 在训练中采用所有认知无线电总吞吐量为基础的奖励函数,以引导收敛至全局最优。
  • 应用改进的DQL算法,通过参数$c$控制目标网络更新的延迟,以在非平稳环境中稳定学习。
  • 通过使用每认知无线电个体吞吐量作为奖励进行测试,验证其在真实非协调部署场景下的鲁棒性。

实验结果

研究问题

  • RQ1在典型认知无线电网络中常见的非平稳、非协调多智能体环境中,多智能体DQL算法能否收敛至最优策略?
  • RQ2标准单智能体DQL是否因环境非平稳性而在非协调、耦合多无线接口场景中无法收敛?
  • RQ3与穷举搜索相比,分布式、无需协调的DQL方法在有限学习时间内能多接近最优解?
  • RQ4奖励函数选择(总吞吐量 vs. 每认知无线电吞吐量)对非协调环境中收敛性和性能有何影响?
  • RQ5哪些超参数设置(如$c$、小批量大小)能在收敛速度与性能精度之间实现最佳权衡?

主要发现

  • 所提出的多智能体DQL技术在有限学习时间内有69%的情况下收敛至最优策略,显著优于标准单智能体DQL。
  • 与穷举搜索最优解相比,该方法在总吞吐量上的平均相对差异为2.49%,表明性能接近全局最优(仅差3%)。
  • 标准单智能体DQL在近一半情况下未能收敛(最优策略达成率仅55–56%),平均相对差异达7.44–9.45%,证明其在非协调多智能体环境中不适用。
  • 增大目标网络更新频率参数$c$(如$c=60$)可提升性能,使平均相对差异降至0.96%,最优策略达成率提高至72%。
  • 小批量大小对性能影响甚微,30和120的设置分别得到相似结果(平均相对差异分别为2.41%和3.75%)。
  • 在每认知无线电奖励函数下方法仍具鲁棒性(平均相对差异4.11%),证实其在完全非协调部署中的可行性,尽管因干扰耦合而略有次优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。