Skip to main content
QUICK REVIEW

[論文レビュー] Transformer Embeddings of Irregularly Spaced Events and Their Participants

Chenghao Yang, Hongyuan Mei|arXiv (Cornell University)|Dec 31, 2021
Morphological variations and asymmetry被引用数 9
ひとこと要約

本稿では、連続時間における不規則な間隔のイベント系列をモデル化するためのTransformerベースのアーキテクチャを提案する。再帰的LSTMに代えて自己注意機構を採用することで、並列計算が可能となり、長距離依存関係のモデル化が向上する。本手法は、ロボットカップやIPTVなどの実世界データセットにおいて、先行モデル(神経的記号的フレームワークを含む)と同等または優れた性能を達成しており、標準的およびルールを組み込んだ設定下で、イベントタイプ予測および対数尤度の面で顕著な向上を示している。

ABSTRACT

The neural Hawkes process (Mei & Eisner, 2017) is a generative model of irregularly spaced sequences of discrete events. To handle complex domains with many event types, Mei et al. (2020a) further consider a setting in which each event in the sequence updates a deductive database of facts (via domain-specific pattern-matching rules); future events are then conditioned on the database contents. They show how to convert such a symbolic system into a neuro-symbolic continuous-time generative model, in which each database fact and the possible event has a time-varying embedding that is derived from its symbolic provenance. In this paper, we modify both models, replacing their recurrent LSTM-based architectures with flatter attention-based architectures (Vaswani et al., 2017), which are simpler and more parallelizable. This does not appear to hurt our accuracy, which is comparable to or better than that of the original models as well as (where applicable) previous attention-based methods (Zuo et al., 2020; Zhang et al., 2020a).

研究の動機と目的

  • 連続時間イベント系列モデルにおける再帰的ニューラルネットワーク(RNN)ベースのモデルの代替として、より効率的かつスケーラブルな手法を開発すること。
  • 時間的間隔を考慮した連続時間位置エンコーディングを組み込むことで、Transformerアーキテクチャを不規則な間隔のイベントに拡張すること。
  • ドメイン固有の論理的ルール(NDTTを介して)を注意機構ベースのモデルと統合し、解釈可能性と性能の両方を向上させること。
  • 自己注意機構が、低データ環境および複雑なイベントダイナミクスにおいて、RNN や先行のアテンションベースのモデルと同等またはそれを上回る性能を発揮できることを実証すること。

提案手法

  • 時刻 t におけるクエリベクトルが、時間的間隔を尊重しながら過去のイベントに注目できるように、連続時間位置エンコーディングを用いる。
  • 時刻 t におけるイベント埋め込みを、時間に特化した位置情報を持つクエリベクトルを用いて、過去のすべてのイベントに注目することで構築する。
  • 観測済みのイベントと同様の方法で、時刻 t における将来の可能性のあるイベントの埋め込みを生成することで、即時のイベント強度の予測を可能にする。
  • A-NHP は、各時刻 t で埋め込みを再計算することで、パラメトリックな減衰関数を避けるTransformerベースのニューラル・ハワース過程を導入する。
  • A-NDTT は、イベント埋め込みが直接的なイベント注目ではなく、記号的 fact に依存する神経的記号的 NDTT フレームワークと統合することで、フレームワークを拡張する。
  • 残差接続と複数ヘッド注目を層間にわたって用いることで、イベント系列の深い文脈表現を構築する。

実験結果

リサーチクエスチョン

  • RQ1再帰的アーキテクチャに依存せずに、自己注意機構が不規則な間隔のイベント系列を効果的にモデル化できるか。
  • RQ2LSTM を Transformer に置き換えることで、特に低データ環境下において、連続時間イベントモデルの性能が向上するか。
  • RQ3アテンションベースのモデルが、NLP や NDTT などの神経的記号的モデルと同等またはそれ以上の性能を発揮できるか、かつより単純で平坦なアーキテクチャを採用できるか。
  • RQ4ドメイン固有の論理的ルール(NDTT を介して)の統合が、アテンションベースのモデルのイベント系列生成性能にどのように影響を与えるか。
  • RQ5連続時間位置エンコーディングが、パラメトリックな減衰関数を用いずに、時間的ダイナミクスをどの程度適切にモデル化できるか。

主な発見

  • A-NHP は、ロボットカップおよびIPTVの両データセットにおいて、元のNHPモデルよりも顕著に優れた対数尤度およびイベントタイプ予測性能を示した(p < 0.05、ペアドパーミュテーション検定)。
  • A-NDTT モデルは、元のNDTTモデルと同等の性能を達成したが、より単純で浅いアーキテクチャを採用しており、この特定のルールベース設定ではアテンションが顕著な性能向上をもたらさないことが示された。
  • IPTVデータセットでは、ルールの組み込みとアテンション機構の両方が、NHPの対数尤度を向上させるとともにイベントタイプ予測誤差を低減させ、両者の組み合わせが最も優れた結果をもたらした。
  • 合成および実世界のデータセット、特に複雑な時間的ダイナミクスを有するデータセットにおいて、アテンションベースのモデルは、先行の最先端のTransformerベースのモデルと同等またはそれを上回る性能を発揮した。
  • 本手法により、各時刻 t で過去のイベントと時間に特化したクエリベクトルを用いた注目によって埋め込みを再計算することで、任意のパラメトリックな減衰関数の必要性が排除された。
  • 自己注意機構により非再帰的かつ並列計算が可能となったため、訓練中に対数尤度の計算が逐次的ではなく並列に処理可能となり、自己回帰的RNNとは異なった利点を有するようになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。