Skip to main content
QUICK REVIEW

[論文レビュー] Transformer Hawkes Process

Simiao Zuo, Haoming Jiang|arXiv (Cornell University)|Feb 21, 2020
Point processes and geometric inequalities参考文献 35被引用数 22
ひとこと要約

本稿では、自己注意メカニズムを活用してイベント系列データにおける短期的および長期的時間的依存関係を捉える、新しいポイント過程モデルであるTransformer Hawkes Process (THP) を提案する。THPは、NHPなどのRNNベースのモデルを凌駆する尤度および予測精度を達成するとともに、優れた計算効率を実現する。THPは、注意メカニズムを通じて構造的知識を統合することにより、関係性を持つグラフなどの構造的データに対しても一般化性能を発揮する。

ABSTRACT

Modern data acquisition routinely produce massive amounts of event sequence data in various domains, such as social media, healthcare, and financial markets. These data often exhibit complicated short-term and long-term temporal dependencies. However, most of the existing recurrent neural network based point process models fail to capture such dependencies, and yield unreliable prediction performance. To address this issue, we propose a Transformer Hawkes Process (THP) model, which leverages the self-attention mechanism to capture long-term dependencies and meanwhile enjoys computational efficiency. Numerical experiments on various datasets show that THP outperforms existing models in terms of both likelihood and event prediction accuracy by a notable margin. Moreover, THP is quite general and can incorporate additional structural knowledge. We provide a concrete example, where THP achieves improved prediction performance for learning multiple point processes when incorporating their relational information.

研究の動機と目的

  • イベント系列データにおける長期的時間的依存関係を捉えることのできないRNNベースのポイント過程モデルの限界を克服すること。
  • 複雑なイベントダイナミクスをモデル化する際の再帰的アーキテクチャの計算非効率性および学習不安定性を解消すること。
  • 短期的および長期的依存関係を併せ持つイベントストリームを効率的かつスケーラブルにモデル化できる汎用フレームワークの開発。
  • 関係性や空間的情報といった構造的知識をポイント過程モデルに統合し、複雑なデータに対する性能向上を図ること。
  • 多様な実世界データセットにおいて、尤度およびイベント予測精度の分野で最先端の性能を示すこと。

提案手法

  • モデルは、すべてのイベントペア間の注意重みを直接計算する自己注意メカニズムを採用し、再帰的構造を用いずとも長距離依存関係のモデル化が可能である。
  • 時間的符号化(式2)を用いて相対的な時間差を注意メカニズムに組み込み、時間的ダイナミクスを保持する。
  • 序列の順序を維持するため、Vaswaniら(2017)に従い位置エンコーディングを適用し、トランスフォーマー構造をサポートする。
  • 観測されたイベント系列上で尤度最大化推定を用いて、エンドツーエンドでモデルを訓練する。
  • 構造的データの場合は、全注意(THP-F)または近隣ベースの注意(THP-S)を用い、空間的近接性を情報伝播の制約に活用することで、関係性を統合する。
  • 本フレームワークは、非構造的およびグラフ構造のイベント系列の両方をサポートし、複雑な依存関係の柔軟なモデル化を可能にする。

実験結果

リサーチクエスチョン

  • RQ1自己注意アーキテクチャは、RNNベースのモデルに比べ、イベント系列データにおける長期的依存関係の捉え方で優れているか?
  • RQ2Transformer Hawkes Processは、NHP や TSES といった既存モデルに比べ、尤度および予測精度が優れているか?
  • RQ3関係性や構造的知識の統合は、マルチノードイベントシステムにおけるモデル性能をどのように向上させるか?
  • RQ4自己注意や時間的符号化といったアーキテクチャ的要素が、モデル性能に与える影響は何か?
  • RQ5THPは、RNNベースのベースラインと比較して、モデルサイズおよび学習速度の面でどのようにスケーリングするか?

主な発見

  • 911-CallsおよびEarthquakeデータセットにおいて、THPはNHPおよびTSESに比べ顕著に高い対数尤度およびイベント予測精度を達成し、Retweetsデータセットでは最大3.5ポイントの尤度向上を示した。
  • Retweetsデータセットでは、THPが時間的符号化を用いることで対数尤度-2.03を達成したのに対し、NHPは-5.60であった。これは顕著な性能向上を示している。
  • 10万~20万パラメータのTHPは、NHP(100万パラメータ)およびTSES(200万パラメータ)を上回る性能を示し、パラメータ効率性に優れていることがわかった。
  • THPは、NHPに比べ最大2.56倍の高速化を達成し、モデルサイズの異なる条件でも一貫した性能を発揮した。
  • THP-S(近隣ベースの注意を用いた構造的THP)は、THP-F(全注意)に比べ、特にデータが少ない状況下で予測性能が向上し、不適切な注意依存関係を低減した。
  • アブレーションスタディの結果、自己注意および時間的符号化の両方が重要な構成要素であることが確認され、それらを除去すると対数尤度が著しく低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。