Skip to main content
QUICK REVIEW

[论文解读] BriskStream: Scaling Data Stream Processing on Shared-Memory Multicore Architectures

Shuhao Zhang, Jiong He|arXiv (Cornell University)|Jan 1, 2019
Advanced Database Systems and Queries参考文献 46被引用 5
一句话总结

BriskStream 是一个共享内存数据流处理系统,引入了相对位置感知调度(RLAS),这是一种新颖的优化范式,通过建模算子间内存访问距离来考虑非统一内存访问(NUMA)效应。通过结合分支限界法与三种启发式策略,RLAS 联合优化算子复制与放置,相较于现有系统,在大规模多核服务器上实现了高达一个数量级的吞吐量提升和更优的可扩展性。

ABSTRACT

We introduce BriskStream, an in-memory data stream processing system (DSPSs) specifically designed for modern shared-memory multicore architectures. BriskStream's key contribution is an execution plan optimization paradigm, namely RLAS, which takes relative-location (i.e., NUMA distance) of each pair of producer-consumer operators into consideration. We propose a branch and bound based approach with three heuristics to resolve the resulting nontrivial optimization problem. The experimental evaluations demonstrate that BriskStream yields much higher throughput and better scalability than existing DSPSs on multi-core architectures when processing different types of workloads.

研究动机与目标

  • 为解决现有数据流处理系统(DSPS)在现代共享内存多核架构中可扩展性差和资源利用率低的问题。
  • 克服基于启发式或非 NUMA 感知的算子放置与复制策略的局限性,这些策略未能考虑不同内存访问延迟的差异。
  • 提出一种基于模型引导的系统化方法,联合优化算子复制与放置,同时考虑生产者-消费者算子之间的相对位置(NUMA 距离)。
  • 通过最小化远程内存访问开销,在大规模多插槽服务器上实现高吞吐量、可扩展的流处理。
  • 提供一种可推广的优化框架,适用于运行在现代共享内存多核系统上的内存内、流水线式 DSPS。

提出的方法

  • 提出 RLAS(相对位置感知调度),一种新型执行计划优化范式,建模 NUMA 距离对算子吞吐量和资源需求的影响。
  • 使用分支限界算法探索算子放置与复制的解空间,由不同 NUMA 配置下性能的预测模型引导。
  • 引入三种关键启发式策略:(1) 基于边的决策机制,聚焦于连接的算子对;(2) 最佳适配放置与冗余消除,以减少搜索空间;(3) 可调粒度控制,实现优化深度与效率之间的权衡。
  • 集成动态瓶颈检测与迭代式复制扩展机制,根据当前放置性能识别瓶颈算子并提升其复制级别。
  • 实现 BriskStream 作为新型 DSPS,支持 Storm/Heron 兼容的 API,增强共享内存优化技术,如无锁数据结构和缓存感知内存管理。
  • 采用预测性能模型,基于放置决策估算算子吞吐量,实现对候选执行计划的准确评估。

实验结果

研究问题

  • RQ1在考虑 NUMA 效应的共享内存多核流处理系统中,如何联合优化算子放置与复制以最大化吞吐量?
  • RQ2与传统放置策略相比,考虑生产者-消费者算子之间的相对位置(NUMA 距离)在多大程度上能提升系统可扩展性与性能?
  • RQ3基于模型引导的分支限界优化方法能否有效应对由 NUMA 效应引起的动态性能变化所导致的复杂、随机的解空间?
  • RQ4在大规模多插槽服务器上,RLAS 与基于启发式的策略(如轮询或首次适应)相比,在吞吐量与可扩展性方面表现如何?
  • RQ5基于放置感知瓶颈检测的算子复制调优对整体系统吞吐量有何影响?

主要发现

  • 在配备 256 个核心和 2TB 内存的八插槽服务器上,BriskStream 的吞吐量相比现有开源 DSPS(如 Storm 和 Flink)最高提升 10 倍。
  • 该系统展现出更优的可扩展性,在核心数量增加时仍能保持高吞吐量,优于基于启发式和基线的非 NUMA 感知系统。
  • RLAS 通过将生产者-消费者算子对战略性地放置在更近的 NUMA 节点上,显著减少了远程内存访问开销,带来可测量的性能提升。
  • RLAS 中的三种启发式策略有效缩小了解空间并提升搜索效率,实现在不牺牲解质量的前提下可扩展的优化。
  • 与先前工作中基于启发式的策略相比,RLAS 在多样化工作负载下表现更优,避免陷入局部最优,并能自适应应对工作负载特定的瓶颈。
  • 将动态瓶颈检测与复制扩展机制结合,实现了更有效的负载均衡和更高的端到端吞吐量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。