Skip to main content
QUICK REVIEW

[论文解读] Transformer Hawkes Process

Simiao Zuo, Haoming Jiang|arXiv (Cornell University)|Feb 21, 2020
Point processes and geometric inequalities参考文献 35被引用 22
一句话总结

本文提出Transformer霍克斯过程(THP),一种新颖的点过程模型,利用自注意力机制捕捉事件序列数据中的短期与长期时间依赖关系,在似然度和预测准确率方面优于基于RNN的模型(如NHP),同时实现更高的计算效率。THP通过注意力机制整合结构知识,能够很好地泛化到结构化数据(如关系图)。

ABSTRACT

Modern data acquisition routinely produce massive amounts of event sequence data in various domains, such as social media, healthcare, and financial markets. These data often exhibit complicated short-term and long-term temporal dependencies. However, most of the existing recurrent neural network based point process models fail to capture such dependencies, and yield unreliable prediction performance. To address this issue, we propose a Transformer Hawkes Process (THP) model, which leverages the self-attention mechanism to capture long-term dependencies and meanwhile enjoys computational efficiency. Numerical experiments on various datasets show that THP outperforms existing models in terms of both likelihood and event prediction accuracy by a notable margin. Moreover, THP is quite general and can incorporate additional structural knowledge. We provide a concrete example, where THP achieves improved prediction performance for learning multiple point processes when incorporating their relational information.

研究动机与目标

  • 解决基于RNN的点过程模型在捕捉事件序列中长期时间依赖关系方面的局限性。
  • 克服递归架构在建模复杂事件动态时存在的计算效率低下和训练不稳定的缺陷。
  • 开发一种可扩展、高效且可泛化的框架,用于建模同时包含短期与长期依赖关系的事件流。
  • 将结构知识(如关系或空间信息)整合到点过程建模中,以提升在复杂数据上的性能。
  • 在多种真实世界数据集上展示最先进的似然度和事件预测准确率表现。

提出的方法

  • 该模型采用自注意力机制,直接计算所有事件对之间的注意力权重,从而在无需循环结构的情况下实现长程依赖建模。
  • 通过时间编码(公式2)将相对时间差注入注意力机制,以保持时间动态特性。
  • 应用位置编码以维持序列顺序,遵循Vaswani等人(2017)的方法,以支持Transformer架构。
  • 通过在观测事件序列上进行最大似然估计,实现端到端训练。
  • 对于结构化数据,THP通过全注意力(THP-F)或基于邻域的注意力(THP-S)整合关系信息,利用空间接近度限制信息流动。
  • 该框架支持非结构化和图结构的事件序列,能够灵活建模复杂依赖关系。

实验结果

研究问题

  • RQ1基于自注意力的架构是否能在捕捉事件序列数据中的长期依赖关系方面优于基于RNN的模型?
  • RQ2Transformer霍克斯过程是否在似然度和预测准确率方面优于现有模型(如NHP和TSES)?
  • RQ3在多节点事件系统中,整合关系或结构信息如何提升建模性能?
  • RQ4自注意力和时间编码等架构组件对模型性能有何影响?
  • RQ5与基于RNN的基线模型相比,THP在模型规模和训练速度方面如何扩展?

主要发现

  • 在911-Calls和地震数据集上,THP在对数似然度和事件预测准确率方面显著优于NHP和TSES,尤其在Retweets数据集上对数似然度最高提升达3.5个点。
  • 在Retweets数据集上,加入时间编码的THP对数似然度达到-2.03,而NHP为-5.60,表现出显著的性能提升。
  • THP使用10万至20万参数的模型优于NHP(100万参数)和TSES(200万参数),展现出更优的参数效率。
  • THP相比NHP实现最高达2.56倍的训练加速,且在不同模型规模下均保持一致性能。
  • THP-S(基于邻域注意力的结构化THP)在事件预测方面优于THP-F(全注意力),尤其在低数据环境下,通过减少虚假注意力依赖关系提升了性能。
  • 消融实验表明,自注意力和时间编码均为关键组件,其移除将导致对数似然度显著下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。