Skip to main content
QUICK REVIEW

[論文レビュー] RDIS: Random Drop Imputation with Self-Training for Incomplete Time Series Data

Tae-Min Choi, Jisu Kang|arXiv (Cornell University)|Oct 20, 2020
Data Stream Mining Techniques参考文献 38被引用数 6
ひとこと要約

本稿では、エントロピーに基づく疑似値フィルタリングと組み合わせたランダムドロップ補完(RDI)を用いて、不完全な時系列データを補完するための新しい自己学習フレームワークRDISを提案する。RDISは、観測値をランダムにドロップして補完モデルを明示的に学習させ、欠損データの高信頼度疑似値を活用することで性能を向上させ、実世界の大気質およびガスセンサーデータセットにおいて最先端の結果を達成した。

ABSTRACT

Time-series data with missing values are commonly encountered in many fields, such as healthcare, meteorology, and robotics. The imputation aims to fill the missing values with valid values. Most imputation methods trained the models implicitly because missing values have no ground truth. In this paper, we propose Random Drop Imputation with Self-training (RDIS), a novel training method for time-series data imputation models. In RDIS, we generate extra missing values by applying a random drop on the observed values in incomplete data. We can explicitly train the imputation models by filling in the randomly dropped values. In addition, we adopt self-training with pseudo values to exploit the original missing values. To improve the quality of pseudo values, we set the threshold and filter them by calculating the entropy. To verify the effectiveness of RDIS on the time series imputation, we test RDIS to various imputation models and achieve competitive results on two real-world datasets.

研究の動機と目的

  • 欠損値の真値が入手できない状況における補完モデルの学習の課題に対処すること。
  • 観測値をランダムにドロップすることで合成された欠損データを用いて、補完モデルの明示的学習を可能にすること。
  • 疑似値を用いた自己学習により、高い欠損率の状況下でも一般化性能を向上させ、過学習を低減すること。
  • エントロピーに基づく信頼度スコアリングを用いて、低信頼度の疑似値を効果的にフィルタリングする信頼性の高い手法を開発すること。
  • RDISの有効性を複数のディープラーニングアーキテクチャおよび実世界の時系列データセットにおいて実証すること。

提案手法

  • RDIは、不完全な時系列データから観測値をランダムにドロップすることで拡張された訓練データを生成し、補完学習を明示的に行えるようにする。
  • 複数のRDIで学習されたモデルをアンサンブル学習することで、モデルのロバスト性と性能を向上させる。
  • 元の欠損値を活用するために、事前に学習されたモデルから疑似値を生成することで自己学習を導入する。
  • 疑似値はエントロピーに基づく信頼度スコアリングでフィルタリングされる:エントロピーが低いほど信頼度が高く、信頼性が高くなる。
  • 最終的なモデルは、観測値と高信頼度の疑似値の組み合わせで学習され、疑似値は定期的に更新される。
  • 分散(エントロピーの代理)に対するしきい値が、訓練に使用する信頼性の高い疑似値の選択に用いられる。

実験結果

リサーチクエスチョン

  • RQ1ランダムドロップ補完(RDI)は、観測値をランダムにドロップすることで合成された欠損データを用いて、時系列補完モデルの明示的学習を可能にするか?
  • RQ2エントロピーでフィルタリングされた疑似値を用いた自己学習は、実際の欠損データにおける補完性能を向上させるのにどの程度有効か?
  • RQ3RDIの最適なランダムドロップレートは、異なる欠損率において補完精度を最大化するためにどの程度か?
  • RQ4疑似値の更新頻度は、モデルの収束と性能にどのように影響するか?
  • RQ5RDISは、多次元実世界の時系列データセットにおいて、既存の最先端手法を一貫して上回ることができるか?

主な発見

  • RDISは、大気質データセットおよびガスセンサーデータセットの両方で最先端の性能を達成し、既存の手法を顕著に上回った。
  • 大気質データセットでは、30%のランダムドロップレートでMSEを0.2091まで低下させ、ベースラインモデルを上回った。
  • ガスセンサーデータセットでは、20%のランダムドロップレートでMSEを0.0278まで低下させ、最も低い値を記録した。
  • アブレーションスタディの結果、RDISはRDIおよびベースラインモデルよりも一貫して性能を向上させたが、特に高い欠損率(例:50%)の状況で顕著であった。
  • エントロピーに基づくフィルタリングは、低分散(低エントロピー)の疑似値において高い正確性を示しており、信頼性の高い疑似値を効果的に同定した。
  • 更新エポックを400に設定した場合が最適なバランスを示したが、更新が多すぎたり少なすぎたりすると性能が低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。