[论文解读] Data augmentation through multivariate scenario forecasting in Data Centers using Generative Adversarial Networks
本文提出了一种基于生成对抗网络(GAN)的数据增强框架,用于数据中心的时间序列数据,支持多变量场景预测和按需异常生成。通过利用条件生成对抗网络(cGAN)和新颖的验证指标(KL散度与均方误差),该方法生成了真实且异构的合成数据,提升了模型的鲁棒性和预测性能,同时不损害系统完整性,在仅使用合成数据训练时也能实现接近基线的准确率。
The Cloud paradigm is at a critical point in which the existing energy-efficiency techniques are reaching a plateau, while the computing resources demand at Data Center facilities continues to increase exponentially. The main challenge in achieving a global energy efficiency strategy based on Artificial Intelligence is that we need massive amounts of data to feed the algorithms. This paper proposes a time-series data augmentation methodology based on synthetic scenario forecasting within the Data Center. For this purpose, we will implement a powerful generative algorithm: Generative Adversarial Networks (GANs). Specifically, our work combines the disciplines of GAN-based data augmentation and scenario forecasting, filling the gap in the generation of synthetic data in DCs. Furthermore, we propose a methodology to increase the variability and heterogeneity of the generated data by introducing on-demand anomalies without additional effort or expert knowledge. We also suggest the use of Kullback-Leibler Divergence and Mean Squared Error as new metrics in the validation of synthetic time series generation, as they provide a better overall comparison of multivariate data distributions. We validate our approach using real data collected in an operating Data Center, successfully generating synthetic data helpful for prediction and optimization models. Our research will help optimize the energy consumed in Data Centers, although the proposed methodology can be employed in any similar time-series-like problem.
研究动机与目标
- 为解决在数据中心训练AI模型时真实世界数据不足的严峻挑战,特别是针对能效优化问题。
- 开发一种可扩展、安全且逼真的合成数据生成方法,以保留多变量时间依赖关系和统计特性。
- 通过在数据生成阶段按需引入异常,提升模型鲁棒性,无需额外数据采集且不危及硬件完整性。
- 利用新颖指标(KL散度与均方误差)验证生成数据的真实性与实用性,并在预测建模任务中与真实数据进行基准对比。
- 通过克服数据稀缺与隐私障碍,推动AI驱动优化在数据中心的广泛应用。
提出的方法
- 在生产环境中采集的真实数据中心多变量时间序列数据(包括温度、湿度及其他运行指标)上训练条件生成对抗网络(cGAN)。
- 通过在特定时间或环境上下文条件下生成合成时间序列场景,实现可控且多样的场景预测。
- 通过在生成过程中修改潜在空间向量,实现对合成数据的按需异常注入,无需使用带标签的异常数据或额外训练。
- 利用Kullback-Leibler(KL)散度与均方误差(MSE)验证生成数据的真实性,比较真实数据与合成数据之间的多变量分布差异。
- 在合成数据、真实数据或两者结合的数据上训练前馈神经网络,以评估其在未见真实数据上的预测性能。
- 该框架可适配任何具有混合数据类型和复杂依赖关系的时间序列问题。
实验结果
研究问题
- RQ1基于GAN的数据增强能否生成真实且保留真实数据中心运行统计特征与时间特性的多变量时间序列数据?
- RQ2在合成数据中注入按需异常,对下游预测模型的鲁棒性与泛化能力有何影响?
- RQ3仅使用合成数据训练的模型在多大程度上能达到与真实数据训练模型相当的性能?
- RQ4KL散度与MSE是否可作为评估多变量合成时间序列数据真实性的有效指标?
- RQ5该方法能否扩展至具有更高维传感器数据的更大、更复杂的数据中心环境?
主要发现
- 所提方法成功生成了与真实数据统计分布高度匹配的合成时间序列数据,KL散度与MSE值均较低,验证了其真实性。
- 仅使用含异常注入的合成数据(TSTR)训练的模型,在温度预测上的均方误差(MSE)为0.103 ± 0.008,湿度预测为0.0168 ± 0.003,接近真实数据训练模型的性能(温度MSE: 0.0738,湿度MSE: 0.0094)。
- 合成异常的引入提升了模型鲁棒性,TSTR结果优于相同设置下未注入异常的模型,表明泛化能力增强。
- 在合成与真实数据联合训练(TSRTR)下进一步提升了性能,温度MSE为0.0532 ± 0.004,湿度MSE为0.0078 ± 0.004,部分情况下优于仅使用真实数据训练的模型。
- 该方法表明,带有可控异常的合成数据可用于训练在真实场景中具有良好泛化能力的模型,且不损害预测准确性。
- 本研究证实,KL散度与MSE是验证多变量合成时间序列数据真实性的有效指标,相比传统指标提供了更全面的比较能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。