Skip to main content
QUICK REVIEW

[论文解读] Dynamic Coded Caching in Wireless Networks Using Multi-Agent Reinforcement Learning

Jesper Pedersen, Alexandre Graell i Amat|arXiv (Cornell University)|Apr 14, 2021
Caching and Content Delivery参考文献 23被引用 4
一句话总结

本文提出一种用于无线网络中动态编码缓存的多智能体强化学习(MARL)框架,采用软超时时间(STTL)策略以最小化回传负载。结果表明,MARL在非均匀空间请求分布下优于经过优化的、依赖先验知识的策略,尤其在 C=4 且 ζ=0.9 时,网络负载降低高达20%。

ABSTRACT

We consider distributed caching of content across several small base stations (SBSs) in a wireless network, where the content is encoded using a maximum distance separable code. Specifically, we apply soft time-to-live (STTL) cache management policies, where coded packets may be evicted from the caches at periodic times. We propose a reinforcement learning (RL) approach to find coded STTL policies minimizing the overall network load. We demonstrate that such caching policies achieve almost the same network load as policies obtained through optimization, where the latter assumes perfect knowledge of the distribution of times between file requests as well the distribution of the number of SBSs within communication range of a user placing a request. We also suggest a multi-agent RL (MARL) framework for the scenario of non-uniformly distributed requests in space. For such a scenario, we show that MARL caching policies achieve lower network load as compared to optimized caching policies assuming a uniform request placement. We also provide convincing evidence that synchronous updates offer a lower network load than asynchronous updates for spatially homogeneous renewal request processes due to the memory of the renewal processes.

研究动机与目标

  • 解决在请求统计信息不确定或未知、以及小型基站(SBS)分布未知情况下的分布式编码缓存中最小化回传负载的挑战。
  • 开发一种强化学习(RL)方法,消除对请求过程分布和SBS可用性先验知识的需求。
  • 研究在空间同质与异质请求过程中,同步与异步缓存更新对网络负载的影响。
  • 设计一种多智能体强化学习(MARL)框架,使SBS能够自主学习缓存策略,实现去中心化与自适应运行。
  • 评估MARL策略相对于假设具备完美知识和同步更新的优化策略的性能,尤其在非均匀请求场景下。

提出的方法

  • 将动态编码STTL缓存问题建模为使用单个智能体进行同步更新的深度确定性策略梯度(DDPG)强化学习问题。
  • 使用神经网络近似演员和评论家函数,请求文件采用独热编码,动作输出为sigmoid函数(表示编码数据包的驱逐概率)。
  • 通过均值为零、方差 σ² = 0.01 的高斯噪声实现探索,并使用Adam优化器,经验回放缓冲区大小为 10⁶,小批量大小为64。
  • 在MARL设置中,将每个SBS建模为独立智能体,支持异步学习与去中心化策略更新,无需全局同步。
  • 使用折扣因子 γ = 0.99 和目标网络更新率 ρ = 0.999 训练DDPG智能体,以稳定学习过程。
  • 在不同用户请求空间分布下评估性能,分布参数为 ζ,即用户请求某文件时位于其关联SBS覆盖范围内的概率。

实验结果

研究问题

  • RQ1基于单智能体DDPG的强化学习方法能否实现与假设具备完美请求统计信息和SBS分布知识的优化策略相当的回传负载降低效果?
  • RQ2在空间同质的更新过程下,同步缓存更新是否比异步更新带来更低的网络负载?
  • RQ3在非均匀空间请求场景下,基于MARL的缓存策略与假设请求分布均匀且更新同步的优化策略相比,性能如何?
  • RQ4更新过程中的记忆特性在多大程度上影响了同步与异步更新的有效性比较?
  • RQ5MARL能否使SBS在无需集中协调或先验统计知识的情况下自主学习有效的缓存策略?

主要发现

  • 基于单智能体DDPG的强化学习方法实现的回传负载降低效果,几乎与需要完美掌握请求统计信息和SBS分布知识的优化策略相当。
  • 在空间同质的更新过程中,同步缓存更新带来的网络负载低于异步更新,表明请求过程的记忆特性对性能的增益超过同步开销的影响。
  • 在空间非均匀请求过程中,MARL策略相比假设分布均匀且更新同步的优化策略,可将网络负载降低高达20%,尤其在 ζ = 0.9 且缓存大小 C = 4 时表现显著。
  • MARL框架在异质场景下优于优化策略,表明去中心化、自主学习机制更能适应现实中的空间非均匀性。
  • 当用户位于SBS覆盖范围内的概率 ζ 偏离均匀情况(ζ = π/8 ≈ 0.39)时,MARL的性能增益最为显著,尤其在 ζ > π/8 时。
  • 结合探索噪声与批量归一化的DDPG算法实现了稳定训练与有效的策略学习,且无需依赖先验统计假设。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。