Skip to main content
QUICK REVIEW

[论文解读] RDIS: Random Drop Imputation with Self-Training for Incomplete Time Series Data

Tae-Min Choi, Jisu Kang|arXiv (Cornell University)|Oct 20, 2020
Data Stream Mining Techniques参考文献 38被引用 6
一句话总结

本文提出RDIS,一种新颖的自训练框架,通过结合随机丢弃插补(RDI)与基于熵的伪值过滤,实现对不完整时间序列数据的插补。RDIS通过随机丢弃观测值显式训练插补模型,并利用高置信度伪值改进缺失数据的插补性能,在真实世界空气质量与气体传感器数据集上达到最先进水平。

ABSTRACT

Time-series data with missing values are commonly encountered in many fields, such as healthcare, meteorology, and robotics. The imputation aims to fill the missing values with valid values. Most imputation methods trained the models implicitly because missing values have no ground truth. In this paper, we propose Random Drop Imputation with Self-training (RDIS), a novel training method for time-series data imputation models. In RDIS, we generate extra missing values by applying a random drop on the observed values in incomplete data. We can explicitly train the imputation models by filling in the randomly dropped values. In addition, we adopt self-training with pseudo values to exploit the original missing values. To improve the quality of pseudo values, we set the threshold and filter them by calculating the entropy. To verify the effectiveness of RDIS on the time series imputation, we test RDIS to various imputation models and achieve competitive results on two real-world datasets.

研究动机与目标

  • 解决缺乏缺失值真实标签时训练插补模型的挑战。
  • 通过随机丢弃观测值生成合成缺失数据,实现插补模型的显式训练。
  • 通过使用伪值的自训练方法,在高缺失率场景下提升泛化能力并减少过拟合。
  • 开发一种基于熵的置信度评分方法,可靠地过滤低置信度伪值。
  • 在多种深度学习架构与真实世界时间序列数据集上,验证RDIS的有效性。

提出的方法

  • RDI通过在不完整时间序列中随机丢弃观测值,生成增强训练数据,从而实现插补模型的显式训练。
  • 在多个RDI训练的模型上应用集成学习,以提升鲁棒性与性能。
  • 引入自训练机制,通过预训练模型生成的伪值来利用原始缺失值。
  • 使用基于熵的置信度评分对伪值进行过滤:熵越低,表示置信度越高、越可靠。
  • 最终模型在观测值与高置信度伪值的组合上进行训练,并定期更新伪值。
  • 使用方差(熵的代理指标)的阈值,仅选择可靠的伪值用于训练。

实验结果

研究问题

  • RQ1随机丢弃插补(RDI)是否能通过生成合成缺失数据,实现时间序列插补模型的显式训练?
  • RQ2使用基于熵过滤的伪值进行自训练,在真实缺失数据上的插补性能提升效果如何?
  • RQ3RDI的最优随机丢弃率是多少,才能在不同缺失率下最大化插补准确率?
  • RQ4伪值更新频率如何影响模型收敛与性能?
  • RQ5RDIS是否能在多变量真实世界时间序列数据集上持续优于现有最先进插补方法?

主要发现

  • RDIS在空气质量与气体传感器数据集上均达到最先进性能,显著优于现有方法。
  • 在空气质量数据集上,RDIS在30%随机丢弃率下将MSE降低至0.2091,优于基线模型。
  • 在气体传感器数据集上,RDIS在20%随机丢弃率下实现了最低MSE 0.0278。
  • 消融实验表明,RDIS在高缺失率(如50%)下持续优于RDI与基线模型。
  • 基于熵的过滤方法能有效识别可靠伪值,表现为低方差(低熵)伪值具有更高准确率。
  • 更新周期为400时达到最佳平衡;更新过于频繁或过少均会降低性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。