[论文解读] Deep Reinforcement Learning for Wireless Scheduling in Distributed Networked Control
本文提出一种基于深度强化学习(DRL)的联合上行链路与下行链路调度算法,用于具有多个频段的全分布式无线网络化控制系统(WNCS)。通过使用基于时间-时长的状态向量将问题建模为马尔可夫决策过程(MDP),该方法在资源受限条件下实现了稳定的控制性能,在数值评估中显著优于基准策略。
We consider a joint uplink and downlink scheduling problem of a fully distributed wireless networked control system (WNCS) with a limited number of frequency channels. Using elements of stochastic systems theory, we derive a sufficient stability condition of the WNCS, which is stated in terms of both the control and communication system parameters. Once the condition is satisfied, there exists a stationary and deterministic scheduling policy that can stabilize all plants of the WNCS. By analyzing and representing the per-step cost function of the WNCS in terms of a finite-length countable vector state, we formulate the optimal transmission scheduling problem into a Markov decision process and develop a deep reinforcement learning (DRL) based framework for solving it. To tackle the challenges of a large action space in DRL, we propose novel action space reduction and action embedding methods for the DRL framework that can be applied to various algorithms, including Deep Q-Network (DQN), Deep Deterministic Policy Gradient (DDPG), and Twin Delayed Deep Deterministic Policy Gradient (TD3). Numerical results show that the proposed algorithm significantly outperforms benchmark policies.
研究动机与目标
- 解决在有限频段下全分布式WNCS中缺乏上行链路与下行链路联合调度的问题。
- 基于数据包到达时间间隔,使用有限长度的可数向量状态,将最优调度问题建模为马尔可夫决策过程(MDP)。
- 推导出以控制与通信参数表示的WNCS充分稳定性条件,确保稳定策略的存在性。
- 开发一种基于深度Q-learning的算法,以解决大规模调度问题,克服传统动态规划中的维数灾难问题。
- 通过建模不同通信链路之间的无线链路空间多样性,体现不同信道条件,与以往研究假设相同误码率的做法不同。
提出的方法
- 定义一种分布式N-被控对象-M-频段WNCS模型,其中控制器负责调度上行链路(传感器到控制器)与下行链路(控制器到执行器)的传输。
- 构建一个表示控制器与执行器连续接收数据包之间时间间隔的状态向量,从而实现有限且可数的状态空间。
- 证明每步代价函数仅依赖于该基于时间-时长的状态向量,从而支持MDP建模。
- 将最优传输调度问题建模为马尔可夫决策过程(MDP),其奖励函数基于系统稳定性与估计误差。
- 通过经验回放与目标网络更新,实现深度Q网络(DQN)智能体学习稳定且确定性的调度策略。
- 将理论稳定性条件整合进学习框架,以引导策略收敛并确保系统整体稳定性。
实验结果
研究问题
- RQ1在有限频段下,联合上行链路与下行链路调度策略能否稳定全分布式WNCS中的所有被控对象?
- RQ2如何有效建模并利用无线链路中的空间多样性(即不同信道条件)以优化调度决策?
- RQ3WNCS存在何种充分稳定性条件,可保证稳定调度策略的存在性?
- RQ4在资源受限的大规模WNCS中,深度强化学习在多大程度上优于传统基准调度策略?
- RQ5基于数据包到达时间间隔的状态表示方式,如何影响DRL调度器的性能与收敛性?
主要发现
- 推导出一个充分稳定性条件,其依赖于控制系统的参数(如被控对象动态特性、控制器增益)与通信参数(如信道误码率、数据包间隔延迟),确保稳定策略的存在性。
- 所提出的基于DRL的调度器在平均估计误差与系统稳定性方面,显著优于轮询与随机调度等基准策略,且在多种仿真场景中表现一致。
- 基于数据包到达时间间隔的状态表示方式有效捕捉了系统动态特性,使DRL智能体即使在高维动作空间下也能学习到最优调度决策。
- 当缺乏空间多样性(即信道条件完全相同)时,该稳定性条件被证明为必要条件,验证了其理论严谨性。
- 数值结果表明,DRL智能体在合理数量的训练回合内即可收敛至稳定策略,即使在最多包含10个被控对象与4个频段的系统中亦然。
- 该方法在资源受限条件下有效平衡了上行链路与下行链路的传输需求,降低了因调度冲突导致的控制性能退化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。