Skip to main content
QUICK REVIEW

[論文レビュー] Prediction with Unpredictable Feature Evolution

Bojian Hou, Lijun Zhang|arXiv (Cornell University)|Apr 27, 2019
Data Stream Mining Techniques参考文献 46被引用数 6
ひとこと要約

本論文は、任意で非同時的な特徴量の進化が生じるオンライン学習のための新しいフレームワークである予測における予測不能な特徴量進化(PUFE)を提案する。不完全な重複期間を行列補完問題としてモデル化し、基本モデルの適応的アンサンブルを用いることで、新しい特徴量空間の開始時でさえも、最良の基本モデルと同等の性能を達成し、特徴量の変化が予測不能なリアルワールドのストリーミング環境においても頑健性を確保する。

ABSTRACT

Learning with feature evolution studies the scenario where the features of the data streams can evolve, i.e., old features vanish and new features emerge. Its goal is to keep the model always performing well even when the features happen to evolve. To tackle this problem, canonical methods assume that the old features will vanish simultaneously and the new features themselves will emerge simultaneously as well. They also assume there is an overlapping period where old and new features both exist when the feature space starts to change. However, in reality, the feature evolution could be unpredictable, which means the features can vanish or emerge arbitrarily, causing the overlapping period incomplete. In this paper, we propose a novel paradigm: Prediction with Unpredictable Feature Evolution (PUFE) where the feature evolution is unpredictable. To address this problem, we fill the incomplete overlapping period and formulate it as a new matrix completion problem. We give a theoretical bound on the least number of observed entries to make the overlapping period intact. With this intact overlapping period, we leverage an ensemble method to take the advantage of both the old and new feature spaces without manually deciding which base models should be incorporated. Theoretical and experimental results validate that our method can always follow the best base models and thus realize the goal of learning with feature evolution.

研究の動機と目的

  • データストリームにおける特徴量の同期的かつ予測可能な進化を仮定する既存手法の制限を解消すること。
  • 旧特徴量が任意のタイミングで消滅する現実世界のシナリオをモデル化し、新旧特徴量の間で不完全な重複期間が生じることを扱うこと。
  • 遷移期間中に欠落した特徴量データを回復し、強力な予測性能を維持するフレームワークを開発すること。
  • 限られたデータがあるにもかかわらず、新しい特徴量空間の初期段階からモデルが頑健でかつ良好に機能することを保証すること。

提案手法

  • 予測不能な特徴量の消滅によって生じる不完全な重複期間を行列補完問題として定式化する。
  • 低ランク行列回復技術を用いて、元のデータ構造が低ランクであるという事実を活用し、特徴量行列の欠損エントリを補完する。
  • 理論的境界を確立し、ターゲット行列を正確に回復するのに Ω(dr ln r) 個の観測エントリが十分であることを示す。ここで、d は行数、r はランクを表す。
  • NOGD、ROGD-f、ROGD-u の3つの基本モデルからなるアンサンブルを構築し、それらの歴史的性能に基づく重み付き統合戦略を用いて適応的に統合する。
  • 補完された行列と完全な現在の特徴量データを統合し、旧特徴量と新特徴量の両方の情報を活用する統一モデルを学習する。
  • 収束性と安定性を保証するため、時間に依存するステップサイズ τt = 1/(c√t) を用いたオンライン学習を適用する。

実験結果

リサーチクエスチョン

  • RQ1旧特徴量がデータストリームの遷移中に予測不能に消滅する場合、行列補完が欠落した特徴量データを効果的に回復できるか?
  • RQ2低ランク仮定の下で、不完全な重複行列を正確に回復するのに最小でどの程度の観測エントリが必要か?
  • RQ3適応的アンサンブル手法は、予測不能な特徴量進化の設定において、個々の基本モデルを上回る性能を示せるか?
  • RQ4提案された PUFE フレームワークは、新しい特徴量空間の初期段階から最良の基本モデルと同等の性能を維持できるか?
  • RQ5予測可能および予測不能な特徴量進化の両シナリオにおいて、FESL-c や FESL-s といった既存手法と比較して、PUFE はどのように性能を発揮するか?

主な発見

  • 22の実験ケースにおいて、PUFE は16件ですべてのベースラインを上回り、合成データおよび実世界データの両方で優れた一般化性能を示した。
  • ドイツ語-P、ドイツ語-U、RFID-P の3件のケースで、PUFE は95%信頼水準で最良の基本モデルを著しく上回った。
  • PUFE の平均累積損失は、すべての時刻で最良のベースラインモデルと一貫して同等であり、新しい特徴量空間の初期段階でさえも同様であった。
  • PUFE は、予測可能および予測不能な両設定で頑健な性能を発揮し、FESL-c や FESL-s を多数のケースで上回った。予測可能な状況でも同様に優れた性能を示した。
  • 理論的分析により、Ω(dr ln r) 個の観測エントリがあれば、正確な行列回復が可能であることが確認され、信頼性の高い補完の基盤が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。