Skip to main content
QUICK REVIEW

[论文解读] Determinism, Complexity, and Predictability in Computer Performance

Joshua Garland, Ryan G. James|arXiv (Cornell University)|May 23, 2013
Evolutionary Algorithms and Applications参考文献 14被引用 4
一句话总结

本文研究了为何确定性预测模型在复杂计算机性能轨迹上会失效,尽管系统本身本质上是确定性的。通过使用排列熵作为时间复杂度的度量,表明高熵与预测精度低下强烈相关——尤其在 gcc 和 sphinx3 等复杂程序中表现明显,而低熵轨迹(如简单微内核)则保持高度可预测性。

ABSTRACT

Computers are deterministic dynamical systems (CHAOS 19:033124, 2009). Among other things, that implies that one should be able to use deterministic forecast rules to predict their behavior. That statement is sometimes-but not always-true. The memory and processor loads of some simple programs are easy to predict, for example, but those of more-complex programs like compilers are not. The goal of this paper is to determine why that is the case. We conjecture that, in practice, complexity can effectively overwhelm the predictive power of deterministic forecast models. To explore that, we build models of a number of performance traces from different programs running on different Intel-based computers. We then calculate the permutation entropy-a temporal entropy metric that uses ordinal analysis-of those traces and correlate those values against the prediction success

研究动机与目标

  • 理解为何确定性预测模型在复杂计算机性能轨迹上会失效,尽管底层系统本质上是确定性的。
  • 研究时间复杂度在确定性系统中如何破坏可预测性。
  • 评估排列熵是否可作为计算机性能指标可预测性的可靠预测器。
  • 使用归一化均方根预测误差(nRMSPE)比较不同程序(微内核与复杂基准)的预测精度。
  • 识别区分可预测与实际不可预测性能动态的排列熵阈值。

提出的方法

  • 使用延迟坐标嵌入法,基于处理器负载和缓存未命中率的时间滞后观测值,重构性能轨迹的状态空间动力学。
  • 利用平均互信息和虚假最近邻方法,估计最优嵌入参数(时间延迟 τ 和维度 m)。
  • 通过阶数为 n 的序模式计算性能时间序列的排列熵(PE),并以 log₂(n!) 归一化,使取值范围在 0 到 1 之间。
  • 基于重构的动力学,采用简单的确定性预测模型,通过归一化均方根预测误差(nRMSPE)计算预测精度。
  • 将排列熵值(n = 4, 5, 6)与 nRMSPE 进行相关分析,评估不同程序和系统指标下的可预测性趋势。
  • 分析排列熵随字长 n 增加的收敛性,以估计持久熵水平,同时考虑有限数据长度的影响。

实验结果

研究问题

  • RQ1排列熵在多大程度上可预测确定性系统中计算机性能轨迹的可预测性?
  • RQ2为何尽管系统本身是确定性的,确定性预测模型在 gcc 和 sphinx3 等复杂程序中仍会失效?
  • RQ3不同性能指标和程序之间,排列熵水平与预测精度(nRMSPE)之间存在何种关系?
  • RQ4有限数据长度如何影响持久排列熵的估计及其预测能力?
  • RQ5是否存在可识别的熵阈值,用以区分可预测与实际不可预测的性能动态?

主要发现

  • 排列熵值超过 0.97,特别是在 403.gcc 和 482.sphinx3 的轨迹中,表明时间复杂度已高到足以压倒确定性预测,与高 nRMSPE(0.1416–0.3670)强烈相关。
  • 低排列熵轨迹(如 col_major 缓存未命中率在 n=4 时为 0.5029)表现出高度可预测性,nRMSPE 低至 0.0080,表明预测能力极强。
  • row_major 和 col_major 缓存未命中轨迹的持久排列熵(0.5–0.6)与混沌动力学一致,支持了先前关于简单微内核中存在混沌吸引子的发现。
  • 微内核的处理器负载轨迹时间复杂度高于其缓存未命中轨迹(PE ≈ 0.8–0.97),可能由于基线值较低且波动性更高。
  • 排列熵随字长 n 增加而下降,但衰减速率各异:某些轨迹的下降较慢,表明其更接近理论渐近线,意味着熵估计更稳定。
  • 本研究识别出一个实用阈值:当 PE ≤ 0.7 时,对应高度可预测轨迹(nRMSPE < 0.01);当 PE ≥ 0.97 时,表示接近白噪声的复杂度,使确定性模型失效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。