Skip to main content
QUICK REVIEW

[论文解读] Opportunistic View Materialization with Deep Reinforcement Learning

Xi Liang, Aaron J. Elmore|arXiv (Cornell University)|Mar 4, 2019
Cloud Computing and Resource Management参考文献 30被引用 22
一句话总结

本文提出 DQM,一种用于内存列式 OLAP 系统中机会性物化内连接视图的深度强化学习框架。通过在空闲时段使用异步离策略强化学习与反事实配对实验,DQM 在无需依赖启发式规则或 selectivity 估计的情况下,学习自适应的视图创建与淘汰策略,其性能与近似最优基线相当,并能动态适应工作负载变化。

ABSTRACT

Carefully selected materialized views can greatly improve the performance of OLAP workloads. We study using deep reinforcement learning to learn adaptive view materialization and eviction policies. Our insight is that such selection policies can be effectively trained with an asynchronous RL algorithm, that runs paired counter-factual experiments during system idle times to evaluate the incremental value of persisting certain views. Such a strategy obviates the need for accurate cardinality estimation or hand-designed scoring heuristics. We focus on inner-join views and modeling effects in a main-memory, OLAP system. Our research prototype system, called DQM, is implemented in SparkSQL and we experiment on several workloads including the Join Order Benchmark and the TPC-DS workload. Results suggest that: (1) DQM can outperform heuristic when their assumptions are not satisfied by the workload or there are temporal effects like period maintenance, (2) even with the cost of learning, DQM is more adaptive to changes in the workload, and (3) DQM is broadly applicable to different workloads and skews.

研究动机与目标

  • 解决在动态 OLAP 工作负载中静态与基于启发式规则的视图物化策略的局限性。
  • 实现基于数据的自适应视图选择,通过实际查询执行反馈学习,而非依赖假设或启发式规则。
  • 通过强化学习学习最优物化与淘汰策略,降低内存列式 OLAP 系统中的查询延迟。
  • 评估强化学习是否能在无需显式工作负载建模或 selectivity 估计的情况下,有效学习视图管理策略。
  • 证明 DQM 在多样化工作负载下具有鲁棒性,包括存在时间变化与数据倾斜的情况。

提出的方法

  • DQM 使用异步深度 Q 网络(DQN)智能体,基于延迟的性能反馈学习视图物化与淘汰策略。
  • 系统在空闲时段进行配对反事实实验,通过比较有视图与无视图时的查询运行时间,估算物化视图的边际收益。
  • 采用编码当前物化视图与查询特征的状态表示,以指导动作选择。
  • 智能体使用基于查询执行时间减少的奖励信号进行训练,实现对有益决策的有效信用分配。
  • 探索通过 $ε$-greedy 调度管理,初始训练后逐渐衰减至零,以稳定策略。
  • 该框架在 SparkSQL 中实现,并在真实世界工作负载(包括 TPC-DS 与 Join Order Benchmark)上进行评估。

实验结果

研究问题

  • RQ1强化学习是否能在不依赖 selectivity 估计或手工设计启发式规则的情况下,学习到有效的视图物化与淘汰策略?
  • RQ2在不同工作负载与存储约束下,DQM 与最先进的启发式策略(如 HAWC 与 Recycler)相比表现如何?
  • RQ3DQM 在多大程度上能适应工作负载变化与查询模式的时间动态变化?
  • RQ4在数据与计算开销方面,学习过程的效率如何?
  • RQ5DQM 能在多大程度上接近假设性的最优基准(如 Belady*)?

主要发现

  • 当 HAWC 与 Recycler 的底层假设不成立,或工作负载表现出时间动态性时,DQM 的性能优于这些启发式策略。
  • 即使计入学习与探索成本,DQM 在 Join Order Benchmark 与 TPC-DS 工作负载上均实现了比启发式基线更低的累积查询运行时间。
  • 训练完成后,当禁用探索后,DQM 将整体性能提升了约 15%,表明其具备高数据效率与快速收敛能力。
  • DQM 的性能与 Belady*(一种利用完美前瞻选择最优视图的假设性最优基准)相当,证明其具备强大的学习能力。
  • 该系统在不同工作负载与数据倾斜分布下均保持鲁棒性,展现出广泛的适用性。
  • 在空闲时段使用配对反事实实验,为信用分配提供了强大且可靠的信号,使 DQM 能够在无需显式工作负载建模的情况下实现有效学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。