Skip to main content
QUICK REVIEW

[论文解读] On Bootstrapping Machine Learning Performance Predictors via Analytical Models

Diego Didona, Paolo Romano|arXiv (Cornell University)|Oct 19, 2014
Software System Performance and Reliability参考文献 37被引用 13
一句话总结

本文提出了一种名为 Bootstrapping 的灰盒技术,结合分析模型(AM)与机器学习(ML),以提升分布式系统中的性能预测。通过使用 AM 生成初始合成训练集,并利用实际运行数据迭代优化,该方法在外推和低质量分析模型场景下,相比纯 ML 或 AM 方法,均实现了更高的准确性。

ABSTRACT

Performance modeling typically relies on two antithetic methodologies: white box models, which exploit knowledge on system's internals and capture its dynamics using analytical approaches, and black box techniques, which infer relations among the input and output variables of a system based on the evidences gathered during an initial training phase. In this paper we investigate a technique, which we name Bootstrapping, which aims at reconciling these two methodologies and at compensating the cons of the one with the pros of the other. We thoroughly analyze the design space of this gray box modeling technique, and identify a number of algorithmic and parametric trade-offs which we evaluate via two realistic case studies, a Key-Value Store and a Total Order Broadcast service.

研究动机与目标

  • 解决纯黑盒机器学习(外推性能差、维度灾难)与白盒分析建模(近似不准确)在性能预测中的局限性。
  • 通过混合方法调和分析模型(泛化能力强、无需训练数据)与机器学习(在已知区域精度高)的优势。
  • 识别并分析 Bootstrapping 设计中影响模型准确性和构建时间的关键算法与参数权衡。
  • 在两个真实分布式系统上对技术进行实证评估:一个键值存储系统与一个全序广播服务。
  • 证明经过微调的模型可超越独立的 ML 与 AM 模型,即使分析模型质量较低。

提出的方法

  • 使用分析模型(AM)生成初始合成训练集,以模拟系统在输入参数空间中的行为。
  • 在初始合成数据集上训练机器学习预测器(如 Cubist),构建灰盒预测器。
  • 通过整合从生产系统中收集的实际性能测量数据,逐步更新训练集。
  • 应用两种更新策略:'Merge'(合并合成与真实样本)与 'RNR2'(将靠近真实样本的合成样本替换为真实数据)。
  • 通过参数调优(如截断阈值、权重)控制模型重训练过程中合成与真实样本的影响。
  • 使用 MAPE(平均绝对百分比误差)等指标评估模型准确性,涵盖不同真实数据包含比例与 AM 质量水平。

实验结果

研究问题

  • RQ1与独立的分析模型或机器学习模型相比,Bootstrapping 技术在性能预测准确性方面有何改进?
  • RQ2设计 Bootstrapping 流水线时,关键的算法与参数权衡是什么?它们如何影响模型准确性与训练时间?
  • RQ3经过微调的模型性能对底层分析模型质量的敏感度如何?
  • RQ4Bootstrapping 技术能否有效利用真实运行数据纠正不准确分析模型中的错误?
  • RQ5不同样本更新策略(如 Merge 与 RNR2)如何影响模型鲁棒性与准确性,特别是在真实数据稀疏的区域?

主要发现

  • Bootstrapping 技术显著提升了与纯分析模型及黑盒机器学习相比的预测准确性,尤其在外推场景中表现突出。
  • 即使分析模型误差率较高(如 MAPE 达 70%),经过微调的模型仍优于纯黑盒学习器 Cubist。
  • 当分析模型质量较差时,RNR2 更新策略(主动替换靠近真实样本的合成样本)优于 Merge 策略。
  • 随着 AM 质量下降,RNR2 与 Merge 的性能差距扩大,表明在初始模型不准确时,更激进地整合真实数据更为有效。
  • 超参数(如截断阈值、权重)的合理调优至关重要——调优不当的模型性能可能反而劣于独立的 AM 或 ML 模型。
  • 该方法有效利用了分析模型的泛化能力,同时通过真实世界数据纠正其不准确性,从而扩大了机器学习组件的有效训练空间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。