[论文解读] Long-Term Missing Value Imputation for Time Series Data Using Deep Neural Networks
本文提出一种基于多层感知机(MLP)的深度学习方法,结合无导数超参数优化,用于填补多变量时间序列中的长期缺失值,尤其适用于环境数据。该方法通过先前已填补的值顺序预测缺失值,在捕捉非线性趋势和动态变化方面优于传统的基于R的统计方法(如ImputeTS、mtsdI),尤其在长时间缺失(3个月至3年)的情况下表现更优。
We present an approach that uses a deep learning model, in particular, a MultiLayer Perceptron (MLP), for estimating the missing values of a variable in multivariate time series data. We focus on filling a long continuous gap (e.g., multiple months of missing daily observations) rather than on individual randomly missing observations. Our proposed gap filling algorithm uses an automated method for determining the optimal MLP model architecture, thus allowing for optimal prediction performance for the given time series. We tested our approach by filling gaps of various lengths (three months to three years) in three environmental datasets with different time series characteristics, namely daily groundwater levels, daily soil moisture, and hourly Net Ecosystem Exchange. We compared the accuracy of the gap-filled values obtained with our approach to the widely-used R-based time series gap filling methods ImputeTS and mtsdi. The results indicate that using an MLP for filling a large gap leads to better results, especially when the data behave nonlinearly. Thus, our approach enables the use of datasets that have a large gap in one variable, which is common in many long-term environmental monitoring observations.
研究动机与目标
- 解决在多变量环境时间序列中长期连续缺失(数月到数年)的填补挑战,传统方法在此类情况下失效。
- 开发一种自动化的、数据驱动的方法,用于优化MLP架构以实现缺失值填补,无需依赖人工调参。
- 相比传统统计方法和基于插值的方法,提高对非线性时间动态和季节性趋势的建模准确性。
- 通过提供关键变量在大缺失情况下的可靠填补,使不完整长期环境监测数据集得以有效利用。
- 展示基于代理模型的超参数优化(使用RBF或GP)在时间序列深度学习填补中的有效性。
提出的方法
- 采用多层感知机(MLP)作为深度学习模型,利用目标变量和支持变量的滞后观测值作为输入特征,预测时间序列中的缺失值。
- 应用无导数代理优化方法(基于Müller等人,2019年)自动调优MLP超参数(如层数、神经元数、激活函数),以实现最优性能。
- 使用径向基函数(RBF)或高斯过程(GP)代理模型,高效探索超参数空间,并最小化验证数据上的填补误差。
- 实施顺序填补:从缺失段的起始位置开始,逐个预测缺失值,将先前预测的值作为后续预测的输入。
- 在缺失段前后完全观测的时间序列片段上训练MLP,利用邻近数据信息指导填补过程。
- 在三个真实环境数据集和一个模拟数据集上验证该方法,其特征各不相同:每日地下水位、土壤湿度,以及每小时的生态系统净交换量。
实验结果
研究问题
- RQ1基于自动超参数优化的深度学习模型是否能显著优于传统统计方法(如ImputeTS、mtsdI)在多变量环境时间序列中填补长期缺失值?
- RQ2MLP-based填补方法的性能如何随缺失段大小和在时间序列中的位置而变化?
- RQ3在超参数优化过程中,代理模型的选择(RBF vs. GP)是否显著影响填补的稳定性和准确性?
- RQ4该方法能否有效捕捉缺失数据中的非线性趋势和季节性动态,尤其是在底层数据表现出复杂时间行为时?
- RQ5结合先前预测值反馈的顺序填补策略在长缺失段中是否可行且准确?还是误差累积导致末段性能下降?
主要发现
- 所提出的基于MLP的填补方法在准确性方面显著优于广泛使用的基于R的ImputeTS和mtsdI方法,尤其在非线性和长缺失情况下表现更优。
- 在超参数优化过程中使用径向基函数(RBF)代理模型,相比高斯过程(GP)代理模型,获得了更稳定和一致的性能。
- 最优MLP架构因缺失段大小和时间位置而异,证实了对每个填补任务进行超参数优化的必要性。
- 该方法成功捕捉了缺失数据中的季节性趋势和极端值,展现出对复杂时间动态的强大建模能力。
- 尽管整体性能优异,但在使用前向填补策略时,长缺失段末尾仍观察到误差累积现象,表明未来采用后向或双向填补策略可能进一步提升性能。
- 该方法具有良好的可扩展性,适用于多个缺失段,可与其他方法结合用于小缺失段;未来若整合物理约束,可能进一步提升环境数据填补的准确性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。