[论文解读] Zero-Shot Cost Models for Out-of-the-box Learned Cost Prediction
本文提出零样本成本模型,可在无需在目标数据库上执行查询的情况下,对未见过的数据库实现精确的模型化成本估计。通过利用具备可迁移查询表示的预训练模型以及一种将数据库特定统计信息与模型解耦的新架构,该方法无需微调即可实现当前最优的准确度,并可通过少量额外查询的少样本微调进一步提升性能。
In this paper, we introduce zero-shot cost models which enable learned cost estimation that generalizes to unseen databases. In contrast to state-of-the-art workload-driven approaches which require to execute a large set of training queries on every new database, zero-shot cost models thus allow to instantiate a learned cost model out-of-the-box without expensive training data collection. To enable such zero-shot cost models, we suggest a new learning paradigm based on pre-trained cost models. As core contributions to support the transfer of such a pre-trained cost model to unseen databases, we introduce a new model architecture and representation technique for encoding query workloads as input to those models. As we will show in our evaluation, zero-shot cost estimation can provide more accurate cost estimates than state-of-the-art models for a wide range of (real-world) databases without requiring any query executions on unseen databases. Furthermore, we show that zero-shot cost models can be used in a few-shot mode that further improves their quality by retraining them just with a small number of additional training queries on the unseen database.
研究动机与目标
- 解决在工作负载驱动的模型化成本估计中,为每个新数据库收集训练数据所涉及的高昂查询执行成本问题。
- 在不执行任何目标数据库查询的情况下,实现对未见数据库的精确成本估计。
- 设计一种可在多种数据库和数据特征间泛化的模型架构与查询表示方法。
- 证明零样本成本模型即使在无任何数据库特定训练的情况下,也能超越现有工作负载驱动模型的性能。
- 通过极少量额外的查询执行实现少样本微调,以进一步提升准确度。
提出的方法
- 提出一种新型模型架构,将数据库特定统计信息(如表基数)与查询计划特征分离,以实现模型的可迁移性。
- 引入一种可迁移的查询表示方法,通过数据库无关的特征(如元组宽度和算子选择性)编码查询计划。
- 在多样化的数据库和工作负载语料库上预训练模型,以学习通用的成本估计模式。
- 通过输入可迁移的查询表示和数据库统计信息,将预训练模型用作任何新未见数据库的零样本估计器。
- 通过在新数据库上执行少量查询对零样本模型进行微调,以在少样本模式下进一步提升准确度。
- 通过将数据统计信息作为输入特征而非学习组件,实现模型训练与数据库特定数据的解耦。
实验结果
研究问题
- RQ1一个模型化成本估计器是否能在不执行任何目标数据库查询的情况下,泛化到完全未见过的数据库?
- RQ2一个具备可迁移查询表示的预训练模型是否能在无数据库特定训练的情况下,对多样化的真实世界数据库实现高准确度?
- RQ3与需要大量查询执行的最先进工作负载驱动模型相比,零样本成本估计的性能如何?
- RQ4通过少样本微调,能在多大程度上进一步提升零样本成本模型的准确度?
- RQ5哪些特征和表示技术对于实现在不同数据库间的零样本泛化至关重要?
主要发现
- 零样本成本模型在未见过的数据库(如 IMDB)上实现的准确度高于最先进工作负载驱动模型,且无需在目标数据库上执行任何查询。
- 即使后者在 IMDB 数据库上训练耗时超过 5 小时的查询执行,零样本模型仍表现更优。
- 在未见数据库上仅通过少量额外查询的少样本微调,可进一步提升零样本基线的估计准确度。
- 所提出的基于元组宽度和算子选择性等特征的可迁移查询表示,实现了在多样化数据库和数据特征间的泛化能力。
- 模型架构成功地将数据库特定统计信息与学习到的模式解耦,实现了无需从头开始重新训练的可迁移性。
- 该方法消除了为每个新数据库或数据更新重复进行昂贵的训练数据收集的需要,从而实现了模型化成本估计的可扩展部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。