[论文解读] Estimation of missing data by using the filtering process in a time series modeling
本文提出了一种基于滤波的新型方法,通过利用ARIMA建模来估计时间序列中的缺失数据,使用的是马来西亚1969年至1997年的月度降雨量数据。该方法基于自相关性应用加权移动平均滤波器,在拟合ARIMA(1,0,0)(0,1,1)₆模型之前对缺失值进行插补,实现了与完整数据相当的预测精度(完整数据的Theil's U = 0.72086,缺失数据的Theil's U = 0.72635),表明该方法对缺失观测具有鲁棒性。
This paper proposed a new method to estimate the missing data by using the filtering process. We used datasets without missing data and randomly missing data to evaluate the new method of estimation by using the Box - Jenkins modeling technique to predict monthly average rainfall for site 5504035 Lahar Ikan Mati at Kepala Batas, P. Pinang station in Malaysia. The rainfall data was collected from the $1^{st}$ January 1969 to $31^{st}$ December 1997 in the station. The data used in the development of the model to predict rainfall were represented by an autoregressive integrated moving - average (ARIMA) model. The model for both datasets was ARIMA$(1,0,0)(0,1,1)_s$. The result checked with the Naive test, which is the Thiel's statistic and was found to be equal to $U=0.72086$ for the complete data and $U=0.726352$ for the missing data, which mean they were good models.
研究动机与目标
- 开发一种基于滤波技术的稳健方法,用于估计时间序列数据中的缺失值。
- 评估在人工引入缺失观测的数据集中,ARIMA模型的预测性能。
- 将所提出的基于滤波的插补方法与简单预测法相比,比较ARIMA预测的准确性。
- 验证滤波过程在存在缺失数据的情况下保持模型预测精度的有效性。
提出的方法
- 所提出的方法使用加权移动平均滤波器,其中权重基于完整数据集的自相关性推导得出。
- 通过基于完整序列相关结构的权重ϕi,将缺失值替换为相邻观测值的线性组合。
- 然后使用Box-Jenkins ARIMA方法对插补后的数据集进行建模,具体为ARIMA(1,0,0)(0,1,1)₆。
- 使用最大似然估计法拟合模型,并对残差进行诊断检查以验证模型的充分性。
- 通过Theil's U统计量评估预测精度,将ARIMA预测结果与简单预测法进行比较。
- 该方法在1969年至1997年期间的月平均降雨量数据上进行了测试,缺失值被随机引入,并通过滤波过程进行插补。
实验结果
研究问题
- RQ1基于滤波的插补方法是否能在数据缺失的情况下保持ARIMA模型的预测精度?
- RQ2在使用所提出的滤波方法时,ARIMA模型在完整数据与缺失数据场景下的性能表现如何比较?
- RQ3插补数据的预测精度是否在统计上与完整数据集的预测精度相当?
- RQ4该滤波方法是否优于或至少不逊于标准插补技术(如均值替代法或简单预测法)?
主要发现
- ARIMA(1,0,0)(0,1,1)₆模型被确定为完整数据集和缺失数据版本降雨量数据集的最佳拟合模型。
- ARIMA模型在插补数据上的预测性能(Theil's U = 0.72635)与在完整数据上的性能(Theil's U = 0.72086)几乎完全相同,表明性能几乎没有下降。
- 模型残差未显示显著的自相关性,证实ARIMA(1,0,0)(0,1,1)₆模型对两个数据集均充分适用。
- ARIMA模型在完整数据上的RMSE为0.66457,在缺失数据版本上为0.65539,显示出一致的精度。
- 插补数据的模型参数(ϕ = 0.178,θ = 0.854)与完整数据的参数(ϕ = 0.159,θ = 0.857)接近,表明参数具有稳定性。
- 结果证实,基于滤波的插补方法能够保持高预测精度,Theil's U值远低于1.0,表明其性能显著优于简单预测法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。