Skip to main content
QUICK REVIEW

[论文解读] A Scalable Learned Index Scheme in Storage Systems

Pengfei Li, Yu Hua|arXiv (Cornell University)|May 8, 2019
Caching and Content Delivery参考文献 34被引用 12
一句话总结

AIDEL 提出了一种可扩展的、基于独立自适应线性回归模型的有学习索引方案,以减少模型间依赖性和重新训练开销。通过学习探测算法(Learning Probe Algorithm)动态根据数据分布分配模型,AIDEL 实现了插入速度提升 2 倍,且查找性能与最先进的有学习索引相当,同时在可扩展性和内存效率方面表现更优。

ABSTRACT

Index structures are important for efficient data access, which have been widely used to improve the performance in many in-memory systems. Due to high in-memory overheads, traditional index structures become difficult to process the explosive growth of data, let alone providing low latency and high throughput performance with limited system resources. The promising learned indexes leverage deep-learning models to complement existing index structures and obtain significant memory savings. However, the learned indexes fail to become scalable due to the heavy inter-model dependency and expensive retraining. To address these problems, we propose a scalable learned index scheme to construct different linear regression models according to the data distribution. Moreover, the used models are independent so as to reduce the complexity of retraining and become easy to partition and store the data into different pages, blocks or distributed systems. Our experimental results show that compared with state-of-the-art schemes, AIDEL improves the insertion performance by about 2$ imes$ and provides comparable lookup performance, while efficiently supporting scalability.

研究动机与目标

  • 解决现有有学习索引因模型间强依赖性及昂贵的重新训练开销而导致的可扩展性差的问题。
  • 降低内存开销,并在处理爆炸性增长数据的内存存储系统中提升性能。
  • 通过解耦不同数据区域的模型,实现高效的数据分区与分布。
  • 在支持低延迟、高吞吐量插入的同时,保持高查找准确率,借助有序列表结构实现。
  • 设计一种模型分配策略,确保预测误差有界,并消除冗余或无效模型。

提出的方法

  • 提出学习探测算法(LPA),根据局部数据分布模式自适应地分配线性回归模型。
  • 在不同数据段使用独立模型,消除模型间依赖性,并支持按段独立重新训练。
  • 构建有序列表结构,以维护数据有序性,并高效支持范围查询。
  • 应用有界预测误差阈值,仅验证高精度模型,确保模型可靠性。
  • 将模型存储于传统索引结构中,实现与现有系统的集成,同时利用机器学习进行位置预测。
  • 将数据分解为多个区域,并为每个区域训练独立的线性模型,支持分布式存储与并行处理。

实验结果

研究问题

  • RQ1如何在现有方案存在高模型间依赖性和昂贵重新训练开销的前提下,使有学习索引具备可扩展性?
  • RQ2独立的、基于区域的线性回归模型是否能提升有学习索引的可扩展性并降低重新训练开销?
  • RQ3基于数据分布的自适应模型分配在多大程度上可减少模型冗余并提升预测准确率?
  • RQ4与 B+树及最先进的有学习索引相比,所提方案在插入与查找吞吐量方面表现如何?
  • RQ5使用有序列表结构是否能高效支持范围查询,同时不牺牲有学习索引的优势?

主要发现

  • 与 B+树相比,AIDEL 的插入吞吐量提升 1.3 倍至 2.7 倍,显著提升了写密集型工作负载的性能。
  • AIDEL 的查找吞吐量约为最先进的有学习索引方案的 2 倍,同时保持了相当的查找准确率。
  • 学习探测算法使模型数量相比基线有学习索引减少高达 90%——仅使用约 15K 个有效模型,而基线方案使用约 200K 个模型且包含 17 个无效模型。
  • 通过确保所有模型的预测误差低于预设阈值,AIDEL 保证了正确性,并消除了无效或冗余模型。
  • 模型的独立性支持高效的分区与分布式存储,显著降低了重新训练成本,提升了系统可扩展性。
  • AIDEL 通过有序列表结构支持高效的范围查询,保持了数据顺序,避免了分离数据结构带来的低效问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。