Skip to main content
QUICK REVIEW

[论文解读] Traffic Prediction and Random Access Control Optimization: Learning and Non-learning based Approaches

Nan Jiang, Yansha Deng|arXiv (Cornell University)|Feb 18, 2020
IoT Networks and Protocols参考文献 14被引用 7
一句话总结

本文提出了一种基于两步协作预训练与学习(CPCL)的优化器,将基于循环神经网络(RNN)的流量预测与基于深度强化学习(DRL)的接入控制配置解耦,显著提升了训练效率和接入性能,相较于传统的单步DRL方法,其在4G/5G网络随机接入控制中实现了高达100倍的收敛速度提升和更高的成功接入率。

ABSTRACT

Random access schemes in modern wireless communications are generally based on the framed-ALOHA (f-ALOHA), which can be optimized by flexibly organizing devices' transmission and re-transmission. However, this optimization is generally intractable due to the lack of information about complex traffic generation statistics and the occurrence of the random collision. In this article, we first summarize the general structure of access control optimization for different random access schemes, and then review the existing access control optimization based on Machine Learning (ML) and non-ML techniques. We demonstrate that the ML-based methods can better optimize the access control problem compared with non-ML based methods, due to their capability in solving high complexity long-term optimization problem and learning experiential knowledge from reality. To further improve the random access performance, we propose two-step learning optimizers for access control optimization, which individually execute the traffic prediction and the access control configuration. In detail, our traffic prediction method relies on online supervised learning adopting Recurrent Neural Networks (RNNs) that can accurately capture traffic statistics over consecutive frames, and the access control configuration can use either a non-ML based controller or a cooperatively trained Deep Reinforcement Learning (DRL) based controller depending on the complexity of different random access schemes. Numerical results show that the proposed two-step cooperative learning optimizer considerably outperforms the conventional Deep Q-Network (DQN) in terms of higher training efficiency and better access performance.

研究动机与目标

  • 为解决大规模物联网和5G网络中动态、不确定的流量与碰撞条件下随机接入控制优化的不可行性。
  • 克服非学习方法的局限性,后者依赖简化的模型,难以应对高复杂度和真实世界动态变化。
  • 改进单步深度强化学习(DRL)方法的不足,后者存在收敛缓慢和计算成本高的问题。
  • 开发一种基于学习的框架,通过协作学习流量预测与控制配置,实现实时自适应并提升性能。

提出的方法

  • 该方法采用两步学习框架:首先,基于RNN的在线监督流量预测器从连续帧中估计未来流量负载。
  • 利用该流量预测结果对DRL智能体进行预训练,以实现接入控制配置,从而加快收敛速度。
  • DRL智能体根据预测的流量实时配置接入控制参数(例如,接入类禁止(ACB)和退避因子(BO))。
  • 使用一个独立的DNN离线估计误差校正后的流量值,用于RNN的训练,从而提高预测精度。
  • RNN与DRL智能体协同训练,RNN为DRL智能体提供上下文信息,降低端到端学习任务的复杂度。
  • 该框架支持在线自适应,并可通过共享预测和多个智能体扩展至多参数接入控制配置。

实验结果

研究问题

  • RQ1两步学习方法是否在随机接入控制的训练效率和接入性能方面优于单步DRL?
  • RQ2将流量预测与控制配置解耦,对收敛速度和优化质量有何影响?
  • RQ3使用预测流量对DRL智能体进行预训练,相较于端到端训练,能在多大程度上提升学习效率?
  • RQ4所提出的CPCL框架是否能有效应用于ACB与BO等复杂随机接入方案,且支持多参数控制?
  • RQ5在成功接入率和计算成本方面,CPCL优化器相较于非机器学习方法和现有机器学习方法表现如何?

主要发现

  • CPCL优化器的收敛速度相比传统DRL优化器最高可提升100倍,仅需约2个训练周期即可收敛,而传统方法需170个周期。
  • CPCL优化器在训练效率和最终接入性能方面均优于DRL优化器,每轮平均成功接入设备数量更高。
  • 对DRL智能体进行预训练可显著加速收敛,证明了利用预测流量作为控制策略学习先验信息的优势。
  • 两步方法通过分离预测与控制,降低了端到端优化问题的复杂度,使学习过程更加稳定高效。
  • CPCL框架支持对动态流量的更好适应,并通过共享预测支持多参数接入控制配置,简化了实现。
  • 数值结果证实,CPCL优化器在成功接入率和可扩展性方面均优于现有非机器学习和机器学习方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。