[论文解读] Exploring Progress in Multivariate Time Series Forecasting: Comprehensive Benchmarking and Heterogeneity Analysis
本文提出了 BasicTS,一个用于多变量时间序列预测的公平基准,通过统一训练与评估流程,解决了模型比较中的不一致性问题。研究发现,模型性能差异主要源于数据异质性,而非模型优越性,并据此提出了一套基于数据时空特性的模型选择或设计路线图。
Multivariate Time Series (MTS) analysis is crucial to understanding and managing complex systems, such as traffic and energy systems, and a variety of approaches to MTS forecasting have been proposed recently. However, we often observe inconsistent or seemingly contradictory performance findings across different studies. This hinders our understanding of the merits of different approaches and slows down progress. We address the need for means of assessing MTS forecasting proposals reliably and fairly, in turn enabling better exploitation of MTS as seen in different applications. Specifically, we first propose BasicTS+, a benchmark designed to enable fair, comprehensive, and reproducible comparison of MTS forecasting solutions. BasicTS+ establishes a unified training pipeline and reasonable settings, enabling an unbiased evaluation. Second, we identify the heterogeneity across different MTS as an important consideration and enable classification of MTS based on their temporal and spatial characteristics. Disregarding this heterogeneity is a prime reason for difficulties in selecting the most promising technical directions. Third, we apply BasicTS+ along with rich datasets to assess the capabilities of more than 45 MTS forecasting solutions. This provides readers with an overall picture of the cutting-edge research on MTS forecasting. The code can be accessed at https://github.com/GestaltCogTeam/BasicTS.
研究动机与目标
- 解决多变量时间序列预测(MTS)中缺乏公平且一致的基准测试问题,该问题导致不同研究之间的性能比较不可靠。
- 系统性地分析 MTS 数据集在时间与空间维度上的异质性,以解释为何先前关于模型性能的结论往往具有误导性。
- 利用所提出的 BasicTS 基准,对 30 多种 MTS 预测模型在 18 个以上数据集上进行全面且可复现的对比。
- 基于数据特征(时间模式与空间依赖性)提出实用的模型选择与设计路线图,强调效率与鲁棒性,而非模型复杂度。
- 强调简单模型如 LTSF-Linear 和 STID 通常优于复杂架构,提示未来研究应优先关注分布漂移建模与不确定性估计。
提出的方法
- 提出 BasicTS,一种统一的训练与评估流程,通过标准化数据预处理、模型训练与评估指标,确保不同模型之间的公平比较。
- 基于时间模式(清晰/稳定、显著分布漂移、或不明确)对 MTS 数据集进行分类,采用统计分析与可视化方法。
- 提出一种新颖的空间依赖性度量方法,用于量化空间依赖性,以区分具有显著空间不可区分性与无显著空间不可区分性的数据集。
- 在 18 个以上真实世界数据集上,对 30 多种 MTS 模型开展大规模、可复现的基准测试,评估指标包括性能(MAE、MSE、MAPE、WAPE)与效率(推理速度、FLOPs)。
- 将基于图、潜在图与非图方法整合进统一评估框架,以评估空间建模对预测精度的影响。
- 基于数据特征(时间模式稳定性与空间依赖性强弱)提出模型选择路线图,推荐简单模型作为强有力的基线。

实验结果
研究问题
- RQ1不一致的基准测试实践在多大程度上导致了 MTS 预测模型之间性能比较的不可靠性?
- RQ2MTS 数据集中时间与空间异质性在多大程度上影响了先前研究中模型性能声明的泛化能力?
- RQ3在公平且标准化的评估条件下,哪些模型架构在多样化 MTS 数据集中持续优于其他模型?
- RQ4在真实场景中,像 LTSF-Linear 或 STID 这类简单模型是否能作为强基线,表现优于更复杂的模型?
- RQ5基于数据特定特征,选择或开发 MTS 预测模型的关键设计原则是什么?
主要发现
- 由于基准测试不一致,近期研究中广泛使用的模型(如 DCRNN 和 GWNet)的性能常被低估,其报告性能下降最高达 33%。
- 在归一化数据上使用基于归一化的评估指标(如 MAE 和 MSE)会导致误差分数过低,具有误导性;而使用重新归一化数据并结合 MAPE 和 WAPE 指标,能获得更可靠、更真实的性能评估结果。
- 2019 年与 2020 年发表的模型(如 Graph WaveNet 和 MTGNN)在标准基准上仍优于许多更新的模型(如 StemGNN 和 GTS),表明模型复杂度的提升并未带来显著性能增益。
- STID 和 STNorm 在大多数数据集上均表现出高效率与强性能,表明在实际应用中,模型效率与简洁性往往比架构复杂性更具价值。
- 学习有效的图结构极具挑战性;仅有 MTGNN 和 STEP 在无需性能退化的前提下成功学习到有用图结构,而大多数其他方法无法在固定或学习基线基础上实现性能提升。
- 近期多数模型性能的提升主要源于架构复杂度的增加,而非预测准确性的实质性提升,尤其在存在分布漂移或模式不明确的数据集上更为明显。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。