Skip to main content
QUICK REVIEW

[論文レビュー] Learning Hawkes Processes from a Handful of Events

Farnood Salehi, William Trouleau|arXiv (Cornell University)|Nov 1, 2019
Point processes and geometric inequalities被引用数 12
ひとこと要約

本稿では、短いイベント系列から多次元ハーケス過程を学習するための変分期待値最大化アルゴリズムを提案する。複数のハイパーパrameterにわたる効率的な最適化と、事後分布を用いたパラメータの不確実性のモデル化を可能にし、小データ環境下で最先端の手法を著しく上回りつつ、大規模データセットでも優れた性能を維持する。

ABSTRACT

Learning the causal-interaction network of multivariate Hawkes processes is a useful task in many applications. Maximum-likelihood estimation is the most common approach to solve the problem in the presence of long observation sequences. However, when only short sequences are available, the lack of data amplifies the risk of overfitting and regularization becomes critical. Due to the challenges of hyper-parameter tuning, state-of-the-art methods only parameterize regularizers by a single shared hyper-parameter, hence limiting the power of representation of the model. To solve both issues, we develop in this work an efficient algorithm based on variational expectation-maximization. Our approach is able to optimize over an extended set of hyper-parameters. It is also able to take into account the uncertainty in the model parameters by learning a posterior distribution over them. Experimental results on both synthetic and real datasets show that our approach significantly outperforms state-of-the-art methods under short observation sequences.

研究の動機と目的

  • 短い観測系列しか利用できない状況において、多次元ハーケス過程の因果的相互作用ネットワークを学習する課題に対処すること。
  • データが少ない状況下で標準的な最尤推定法に伴う過学習と不十分な正則化という課題を克服すること。
  • 単一の共有パラメータに依存するのではなく、拡張されたハイパーパrameterの集合を最適化することで、柔軟で高次元の正則化を可能にすること。
  • パラメータの不確実性を事後分布を学習することで組み込み、因果グラフにおけるエッジ同定の信頼性を提供すること。
  • 疫学的モデル、金融イベント予測、ソーシャルネットワークダイナミクスなどの小データ応用における性能を向上させること。

提案手法

  • モデルパラメータを事前分布をもつ潜在変数として扱うことで、ハーケス過程の学習問題をベイズ推論タスクとして定式化する。
  • 励起行列とハイパーパrameterの上に変分分布を用いて真の事後分布を近似する変分推論フレームワークを開発する。
  • 真の事後分布推定(Eステップ)とELBO(下界)の最大化によるハイパーパラメータ最適化(Mステップ)を繰り返す、変分期待値最大化(V-EM)アルゴリズムを設計する。
  • 励起行列の各要素に対して個別にハイパーパラメータを設定する柔軟な事前分布構造を導入し、個別化された正則化を可能にする。
  • 変分パラメータおよびハイパーパラメータに関するELBOの勾配を、確率的最適化により効率的に計算する。
  • 事後分布近似の分散を用いて不確実性を評価することで、不確実性の定量化を組み込み、特に小データ環境下でのエッジ検出の信頼性を評価する。

実験結果

リサーチクエスチョン

  • RQ1変分期待値最大化アプローチは、最尤推定法と比較して、短いデータレジーム下における多次元ハーケス過程の学習性能を向上させることができるか?
  • RQ2複数の個別化されたハイパーパラメータを最適化することで、単一の共有ハイパーパラメータによる正則化よりも、より優れたモデル表現と一般化性能が得られるか?
  • RQ3パラメータの不確実性を事後分布を用いてモデル化することで、データが少ない状況下でもエッジ同定の信頼性が向上するか?
  • RQ4本手法は、感染拡大や株価変動など、イベント数が限られた実世界のデータセットにおいて、どのように性能を発揮するか?
  • RQ5小データ環境下で優れた性能を発揮する一方で、大規模データセットでも高い性能を維持できるか?

主な発見

  • 54地域の合計5,349イベントからなるエボラ感染データセットにおいて、提案手法VI-SGは予測対数尤度-2.06を達成し、MLE-SGLPの-3.03を著しく上回った。
  • 7,089件のイベントを含む株式市場データセットにおいて、VI-SGは予測対数尤度-1.00を達成し、MLE-SGLPの-2.45および他のベースラインを上回った。
  • 74,294件のイベントを含むEnronメールデータセットにおいて、VI-EXPバージョンは予測対数尤度-0.23を達成し、MLE-ADM4の-0.40を上回った。
  • 学習された因果グラフにおける偽陽性エッジは、真陽性エッジよりも高い不確実性(重みの標準偏差で測定)を示しており、本手法がデータが少ない状況下でも信頼できるエッジを同定できることを確認した。
  • 真の励起行列における真のエッジに対して、最適化された事前分布ハイパーパラメータαが非エッジよりも顕著に大きい値を示しており、効果的な正則化が行われていることが示された。
  • 本手法は大規模データレジームでも優れた性能を維持しており、小データでの利点を失うことなく、データスケールにかかわらず頑健であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。