Skip to main content
QUICK REVIEW

[论文解读] Towards Polyglot Data Stores -- Overview and Open Research Questions

Daniel Glake, Felix Kiehn|arXiv (Cornell University)|Apr 12, 2022
Advanced Database Systems and Queries被引用 4
一句话总结

本文研究了多语言数据存储作为解决单数据库系统在处理多样化且常相互冲突的事务型与分析型工作负载时局限性的方案。提出了一种声明式、自适应的中介器,将应用需求映射到最优的数据存储拓扑结构,强调自适应能力是实现长期系统弹性与性能的关键。

ABSTRACT

Nowadays, data-intensive applications face the problem of handling heterogeneous data with sometimes mutually exclusive use cases and soft non-functional goals such as consistency and availability. Since no single platform copes everything, various stores (RDBMS, NewSQL, NoSQL) for different workloads and use-cases have been developed. However, since each store is only a specialization, this motivates progress in polyglot data management emerged new systems called Mult- and Polystores. They are trying to access different stores transparently and combine their capabilities to achieve one or multiple given use-cases. This paper describes representative real-world use cases for data-intensive applications (OLTP and OLAP). It derives a set of requirements for polyglot data stores. Subsequently, we discuss the properties of selected Multi- and Polystores and evaluate them based on given needs illustrated by three common application use cases. We classify them into functional features, query processing technique, architecture and adaptivity and reveal a lack of capabilities, especially in changing conditions tightly integration. Finally, we outline the benefits and drawbacks of the surveyed systems and propose future research directions and current challenges in this area.

研究动机与目标

  • 解决现代应用中管理异构数据工作负载的挑战,这些应用需要相互冲突的非功能属性,如一致性、可用性与性能。
  • 识别当前多语言与多存储系统(multistore systems)的局限性,特别是其缺乏运行时自适应能力与动态拓扑管理能力。
  • 提出一种声明式、应用层的数据模式规范模型,对数据模式进行功能与非功能需求(如一致性级别、延迟约束)的注释。
  • 设计一种智能、自动化的中介器,根据这些注释将数据路由至合适的数据存储,以实现最优系统拓扑。
  • 通过运行时监控与拓扑重构,实现对应用与数据需求变化的自主适应。

提出的方法

  • 定义三个真实用例——电子商务(OLTP)、分析(OLAP)与混合OLTP/OLAP——以推导出数据管理的代表性需求。
  • 建立功能与非功能特性(如一致性级别、查询接口、模式灵活性)的框架,要求多语言数据存储系统必须支持这些特性。
  • 调查并对比现有多语言与多存储系统(如BigDAWG、Polypheny-DB)在架构、查询处理与自适应能力方面的差异。
  • 提出一种声明式模式注释模型,允许应用指定功能与非功能需求(如“读己所写”、“低写延迟”)。
  • 设计一种智能的评分与路由算法,根据数据存储的能力与注释需求,将模式元素映射到合适的数据存储。
  • 集成监控与反馈机制,以在运行时触发数据存储拓扑与路由策略的自适应变更。

实验结果

研究问题

  • RQ1如何将初始应用需求映射到异构数据存储的最优初始拓扑?
  • RQ2随着需求与数据工作负载随时间演变,如何维持模式元素与数据存储之间的动态映射?
  • RQ3在何种时间点与条件下,系统应触发拓扑自适应——例如,为提升性能、一致性或可用性——通过数据迁移或存储的增减?
  • RQ4在查询处理过程中,如何充分利用单个数据存储的独特能力,同时保持语义完整性?
  • RQ5如何对多语言系统进行监控,以实现其底层数据存储配置的自主、自适应决策?

主要发现

  • 当前的多语言与多存储系统在自适应能力方面存在显著不足,依赖静态配置,无法响应工作负载或需求的变化。
  • 大多数被调研的系统由于集成模式僵化,未能充分挖掘单个数据存储的独特能力,如专用索引或一致性模型。
  • 缺乏运行时监控与反馈回路,导致系统无法自主地根据性能或可用性变化重新配置其拓扑结构。
  • 本文识别出自适应能力是未来多语言数据存储的核心挑战与关键推动力,性能提升的收益可能超过动态重构的开销。
  • 采用声明式注释方法进行模式规范,可精确表达功能与非功能需求,为自动化拓扑选择奠定基础。
  • 所提出的中介器框架旨在通过智能、自动化的映射与路由,弥合应用级SLA与底层数据存储能力之间的差距。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。