Skip to main content
QUICK REVIEW

[论文解读] Learning Runtime Parameters in Computer Systems with Delayed Experience Injection

Michael Schaarschmidt, Felix Gessert|arXiv (Cornell University)|Oct 31, 2016
Caching and Content Delivery参考文献 15被引用 8
一句话总结

该论文提出了一种使用延迟经验注入的归一化优势函数(NAF-DEI)的深度强化学习方法,以在实时延迟约束下动态优化云数据库中的HTTP缓存过期时间。通过在并发环境中异步管理延迟奖励和下一状态信息,NAF-DEI在平均缓存命中率达到88.5%的同时,无效化率仅为7.3%,优于统计泊松估计器,尤其在高写入工作负载下表现更优。

ABSTRACT

Learning effective configurations in computer systems without hand-crafting models for every parameter is a long-standing problem. This paper investigates the use of deep reinforcement learning for runtime parameters of cloud databases under latency constraints. Cloud services serve up to thousands of concurrent requests per second and can adjust critical parameters by leveraging performance metrics. In this work, we use continuous deep reinforcement learning to learn optimal cache expirations for HTTP caching in content delivery networks. To this end, we introduce a technique for asynchronous experience management called delayed experience injection, which facilitates delayed reward and next-state computation in concurrent environments where measurements are not immediately available. Evaluation results show that our approach based on normalized advantage functions and asynchronous CPU-only training outperforms a statistical estimator.

研究动机与目标

  • 解决在强延迟约束和延迟性能反馈环境下学习最优运行时参数的挑战。
  • 实现在云数据库中无需预先离线训练的实时、请求级配置决策。
  • 克服在并发系统中性能指标无法立即获取时的延迟信用分配难题。
  • 开发一种可扩展的仅使用CPU的训练方法,利用细粒度运行时指标实现动态参数调优。
  • 证明深度强化学习在缓存过期时间预测方面可优于传统统计估计器。

提出的方法

  • 该方法采用归一化优势函数(NAFs)实现连续动作空间控制,使用单个神经网络同时输出价值函数和优势函数。
  • 提出延迟经验注入(DEI)机制,用于在奖励和下一状态无法立即获取时异步存储和处理经验。
  • 采用具有优先采样策略的经验回放缓冲区和目标网络以稳定训练,方法与深度Q网络(DQN)相似。
  • 基于缓存命中率和无效化率对奖励进行塑造,动态调整以反映工作负载组合和服务级别目标。
  • 系统实时运行,处理传入请求并在线更新策略参数,无需预训练。
  • 算法仅在CPU上训练,支持在资源受限环境中部署。

实验结果

研究问题

  • RQ1深度强化学习能否有效应用于云数据库中实时、请求级参数调优,且训练开销极低?
  • RQ2在性能指标异步到达的高吞吐量并发系统中,如何高效管理延迟奖励和下一状态信息?
  • RQ3在不同工作负载下,基于DRL的控制器能否优于统计估计器预测最优缓存过期时间?
  • RQ4与全局统计量相比,使用细粒度运行时指标在多大程度上提升了缓存性能?
  • RQ5如何通过奖励塑造平衡高缓存命中率与低无效化率等相互竞争的目标?

主要发现

  • 在10%写入工作负载下,NAF-DEI实现了88.5%的平均缓存命中率和7.3%的无效化率,显著优于泊松估计器(命中率79.5%,无效化率6.8%)。
  • 在30%写入工作负载下,NAF-DEI实现77.7%的缓存命中率和21.4%的无效化率,而泊松估计器为62.6%和15.6%,表明其在高写入率下具有更强的鲁棒性。
  • 该智能体在运行初期几分钟内即学习到有效策略,表明尽管并发度高达1,000请求/秒,仍具备快速收敛能力。
  • 当未对奖励进行工作负载混合调整时,系统系统性地将TTL高估5–10秒,凸显了动态奖励塑造的重要性。
  • 当奖励调整以反映工作负载混合(如目标负载低于1−w)时,TTL随时间合理降低,表明具备自适应行为。
  • 该方法无需解析模型即可实现缓存性能与无效化之间的有效权衡,凸显强化学习在多目标优化中的灵活性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。