Skip to main content
QUICK REVIEW

[论文解读] Deep-Reinforcement Learning Multiple Access for Heterogeneous Wireless Networks

Yiding Yu, Taotao Wang|arXiv (Cornell University)|Dec 1, 2017
Advanced MIMO Systems Optimization参考文献 14被引用 15
一句话总结

本文提出深度强化学习多址接入(DLMA),一种MAC协议,使节点能够在不了解其机制的前提下,自主学习异构无线网络(与TDMA、ALOHA或混合协议共存)中的最优频谱接入策略。采用具有ResNet结构的深度Q网络(DQN),DLMA通过端到端训练实现接近最优的总吞吐量和比例公平性,表现出快速收敛性及对超参数设置的鲁棒性。

ABSTRACT

This paper investigates the use of deep reinforcement learning (DRL) in a MAC protocol for heterogeneous wireless networking referred to as Deep-reinforcement Learning Multiple Access (DLMA). The thrust of this work is partially inspired by the vision of DARPA SC2, a 3-year competition whereby competitors are to come up with a clean-slate design that "best share spectrum with any network(s), in any environment, without prior knowledge, leveraging on machine-learning technique". Specifically, this paper considers the problem of sharing time slots among a multiple of time-slotted networks that adopt different MAC protocols. One of the MAC protocols is DLMA. The other two are TDMA and ALOHA. The nodes operating DLMA do not know that the other two MAC protocols are TDMA and ALOHA. Yet, by a series of observations of the environment, its own actions, and the resulting rewards, a DLMA node can learn an optimal MAC strategy to coexist harmoniously with the TDMA and ALOHA nodes according to a specified objective (e.g., the objective could be the sum throughput of all networks, or a general alpha-fairness objective).

研究动机与目标

  • 设计一种MAC协议,能够在不了解其协议机制的前提下,动态共存于异构无线网络(如TDMA、ALOHA)中。
  • 在动态、实时环境中,通过强化学习实现对最优时隙接入策略的自主学习。
  • 在无需模型假设的前提下,实现通用α-公平性目标,包括总吞吐量最大化与比例公平性。
  • 评估深度强化学习(DRL)相较于传统强化学习(RL)在收敛速度与超参数设置鲁棒性方面的优越性。
  • 通过将Q函数与目标函数解耦,推广Q-learning框架,实现对多样化公平性度量的灵活优化。

提出的方法

  • 采用深度Q网络(DQN)并使用深度残差网络(ResNet)作为函数逼近器,将状态-动作对映射为Q值。
  • 使用回放缓冲区与目标网络以稳定训练,遵循标准DQN训练流程。
  • 通过将Q函数与公平性目标函数解耦,重构Q-learning目标,实现对通用α-公平性度量的优化。
  • 使用从与环境交互中收集的状态-动作-奖励三元组训练DRL智能体,其中状态包含信道占用情况与传输历史。
  • 采用双DQN变体以减少Q值估计中的过度估计偏差。
  • 设计基于吞吐量与公平性度量的奖励函数,目标动态调整以分别针对总吞吐量或比例公平性进行优化。

实验结果

研究问题

  • RQ1基于DRL的MAC协议能否在时隙制环境中,高效共存于未知的异构MAC协议(如TDMA、ALOHA)?
  • RQ2在动态无线网络中,DRL相较于传统RL在收敛速度与超参数设置鲁棒性方面表现如何?
  • RQ3DRL智能体在不了解共存网络底层MAC机制的前提下,能在多大程度上实现接近最优的总吞吐量与比例公平性?
  • RQ4通过将Q函数与目标函数解耦,能否将Q-learning框架推广以支持任意α-公平性目标?
  • RQ5与普通DNN相比,使用ResNet架构是否能提升智能体在不同网络场景下的泛化能力?

主要发现

  • DLMA在与TDMA、ALOHA或混合网络共存时,即使未预先知晓其协议机制,也能实现接近最优的总吞吐量。
  • 经重构的DLMA协议在与TDMA和ALOHA节点共存时,成功实现了比例公平性,性能与具备模型知识的基准节点相当。
  • 在包含一个TDMA节点与一个q-ALOHA节点的混合场景中,DLMA近似实现了所有节点的最优个体吞吐量,表现出有效的公平性平衡。
  • 当三个DRL节点作为单一BigAgent与一个TDMA节点及两个q-ALOHA节点共存时,DLMA实现的吞吐量接近理论最优值,如图11所示。
  • DLMA收敛速度更快,且对非最优超参数更具鲁棒性,适用于快速变化的无线环境。
  • DRL智能体中使用ResNet架构可在无需调整网络深度的情况下,实现不同网络场景下的稳定性能,而普通DNN则需针对具体场景调整网络结构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。