Skip to main content
QUICK REVIEW

[论文解读] Polynesia: Enabling Effective Hybrid Transactional/Analytical Databases with Specialized Hardware/Software Co-Design

Amirali Boroumand, Saugata Ghose|arXiv (Cornell University)|Mar 1, 2021
Distributed systems and fault tolerance参考文献 64被引用 20
一句话总结

Polynesia 是一种软硬件协同设计的 HTAP 数据库系统,通过将工作负载划分为隔离的事务处理与分析处理区域,利用专用加速器和内存内处理技术,减少数据移动和一致性开销。与现有最先进系统相比,其平均事务处理吞吐量提升 1.70 倍,分析处理吞吐量提升 3.74 倍,同时能耗降低 48%。

ABSTRACT

An exponential growth in data volume, combined with increasing demand for real-time analysis (i.e., using the most recent data), has resulted in the emergence of database systems that concurrently support transactions and data analytics. These hybrid transactional and analytical processing (HTAP) database systems can support real-time data analysis without the high costs of synchronizing across separate single-purpose databases. Unfortunately, for many applications that perform a high rate of data updates, state-of-the-art HTAP systems incur significant drops in transactional (up to 74.6%) and/or analytical (up to 49.8%) throughput compared to performing only transactions or only analytics in isolation, due to (1) data movement between the CPU and memory, (2) data update propagation, and (3) consistency costs. We propose Polynesia, a hardware-software co-designed system for in-memory HTAP databases. Polynesia (1) divides the HTAP system into transactional and analytical processing islands, (2) implements custom algorithms and hardware to reduce the costs of update propagation and consistency, and (3) exploits processing-in-memory for the analytical islands to alleviate data movement. Our evaluation shows that Polynesia outperforms three state-of-the-art HTAP systems, with average transactional/analytical throughput improvements of 1.70X/3.74X, and reduces energy consumption by 48% over the prior lowest-energy system.

研究动机与目标

  • 解决现有最先进 HTAP 系统中由数据移动、更新传播和一致性开销导致的性能下降问题。
  • 克服事务处理与分析工作负载之间因资源争用导致的性能干扰。
  • 同时实现高吞吐量和低延迟的事务处理与分析处理,达到与隔离处理相当的性能。
  • 实现具备数据新鲜度和强一致性保证的实时分析。
  • 设计一种满足三项理想 HTAP 特性的系统:工作负载特定优化、数据新鲜度和性能隔离。

提出的方法

  • 将 HTAP 系统划分为专用的事务处理与分析处理区域,每个区域拥有独立的数据副本、优化的执行引擎和定制化的硬件资源。
  • 实现专用硬件加速器和算法,高效实现区域间更新传播,最大限度减少 CPU 到内存的数据移动。
  • 提出一种新颖的数据一致性机制,确保分析查询能看见一致且最新的数据视图,同时不阻塞事务处理工作负载。
  • 在分析区域中利用内存内处理(PIM)架构,减少芯片外内存访问,加速分析查询执行。
  • 设计一种运行时任务调度器,通过跨存储库组的任务窃取实现动态负载均衡,提升资源利用率和吞吐量。
  • 采用以处理器为中心的互连拓扑结构,在多个 HMC 内存堆栈之间实现扩展,同时保持低通信开销。

实验结果

研究问题

  • RQ1软硬件协同设计在多大程度上可以缓解 HTAP 系统中因数据移动和一致性机制导致的性能下降?
  • RQ2通过专用处理区域实现工作负载隔离,能在多大程度上消除事务处理与分析工作负载之间的性能干扰?
  • RQ3内存内处理(PIM)技术是否能显著减少 HTAP 系统中分析工作负载的数据移动和能耗?
  • RQ4该系统如何在实现高吞吐量的同时,保持数据的新鲜度和一致性?
  • RQ5随着数据规模和硬件规模的增加,该协同设计系统的可扩展性和能效表现如何?

主要发现

  • 与三种现有最先进 HTAP 系统相比,Polynesia 的平均事务处理吞吐量提升 1.70 倍,分析处理吞吐量提升 3.74 倍。
  • 与能耗最低的先前系统相比,该系统能耗降低 48%,主要通过最小化芯片外内存访问和使用高效的 PIM 核心实现。
  • 随着数据规模增大,分析吞吐量表现出良好的可扩展性,在数据集大小翻倍、跨越四个 HMC 堆栈的情况下,仍比多实例基线高出最多 3.0 倍。
  • 在 Polynesia 中,当从一个 HMC 堆栈扩展到四个时,事务处理吞吐量仅下降 8.8%,而多实例基线则下降 54.4%。
  • Hybrid-sched 变体中的任务窃取机制降低了远程内存访问开销,使分析吞吐量与理想远程访问基线仅相差 3.2%。
  • 系统在保持低更新应用延迟的同时确保了数据一致性,证明了工作负载之间实现了有效隔离且无性能损失。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。