Skip to main content
QUICK REVIEW

[论文解读] PushdownDB: Accelerating a DBMS using S3 Computation

Xiangyao Yu, Matt Youill|arXiv (Cornell University)|Feb 14, 2020
Cloud Computing and Resource Management参考文献 26被引用 4
一句话总结

PushdownDB 通过将选定的操作(筛选、投影、聚合、连接、分组、Top-K)推送到 AWS S3 使用 S3 Select,加速了数据库查询处理,平均在 TPC-H 基准测试中将查询运行时间减少 6.7 倍,成本降低 30%,证明基于 S3 的计算可有效加速云原生分析工作负载。

ABSTRACT

This paper studies the effectiveness of pushing parts of DBMS analytics queries into the Simple Storage Service (S3) engine of Amazon Web Services (AWS), using a recently released capability called S3 Select. We show that some DBMS primitives (filter, projection, aggregation) can always be cost-effectively moved into S3. Other more complex operations (join, top-K, group-by) require reimplementation to take advantage of S3 Select and are often candidates for pushdown. We demonstrate these capabilities through experimentation using a new DBMS that we developed, PushdownDB. Experimentation with a collection of queries including TPC-H queries shows that PushdownDB is on average 30% cheaper and 6.7X faster than a baseline that does not use S3 Select.

研究动机与目标

  • 评估使用 S3 Select 将数据库操作推送到 AWS S3 的可行性和性能优势。
  • 识别哪些 DBMS 操作符(如筛选、连接、分组)可通过 S3 计算实现有效加速。
  • 设计并实现一种新型 DBMS PushdownDB,原生支持复杂操作符的 S3 基础计算下推。
  • 量化在去耦合云架构中,与传统 EC2 处理相比,S3 计算下推在成本和性能上的改进。
  • 识别当前 S3 Select 接口的局限性,并为未来数据库系统提出改进建议。

提出的方法

  • 将 PushdownDB 实现为一种新型 DBMS,集成 S3 Select 以将筛选、投影、聚合以及连接、分组、Top-K 等复杂操作符推送到 S3。
  • 为每个操作符设计自定义下推逻辑,将 SQL 操作映射为 S3 Select 兼容的表达式,并最小化数据传输。
  • 使用 Parquet 作为底层列式存储格式,以优化 S3 中的谓词下推和列裁剪。
  • 执行微基准测试和 TPC-H 查询,与仅在 EC2 上执行的基线模型进行性能和成本对比。
  • 使用 AWS 计费和监控工具测量运行时间和成本,以评估端到端性能和经济效率。
  • 提出对 S3 Select 的架构扩展,以支持更复杂的操作符并提升数据库工作负载的可用性。

实验结果

研究问题

  • RQ1哪些 DBMS 操作符可通过 S3 Select 有效推送到 S3?在何种条件下这种做法具有成本效益?
  • RQ2通过 S3 Select 实现计算下推,对连接、分组、Top-K 等复杂操作符的查询性能和成本有何影响?
  • RQ3在去耦合云存储架构中,S3 Select 在多大程度上可减少数据传输并提升运行时间?
  • RQ4对于分析工作负载,执行操作在 EC2 与 S3 之间存在哪些性能与成本权衡?
  • RQ5如何扩展当前的 S3 Select 接口,以可扩展且高效的方式支持更复杂的数据库操作?

主要发现

  • PushdownDB 在 TPC-H 查询子集上,相对于仅在 EC2 上执行的基线模型,平均实现了 6.7 倍的性能提升。
  • 通过最小化数据传输并利用 S3 Select 的定价模型,系统平均将整体查询成本降低了 30%。
  • 筛选、投影和聚合等简单操作符始终具有成本效益,因为 S3 Select 成本低且数据减少效果显著。
  • 连接、分组和 Top-K 等复杂操作符虽需自定义重实现,但推送到 S3 后仍能带来显著的性能和成本优势。
  • Parquet 列式格式通过在 S3 中实现高效的谓词下推和列裁剪,显著提升了性能。
  • 研究揭示了当前 S3 Select 接口的局限性,如不支持复杂数据类型和操作符,促使提出未来增强的建议。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。