[论文解读] Transformer Embeddings of Irregularly Spaced Events and Their Participants
本文提出一种基于Transformer的架构,用于建模连续时间中的不规则时间间隔事件序列,用自注意力机制替代循环LSTM,实现并行计算并更好地捕捉长距离依赖关系。该方法在RoboCup和IPTV等真实世界数据集上,相较于先前模型(包括神经符号框架),实现了具有竞争力或更优的性能,尤其在事件类型预测和对数似然度方面有显著提升,无论是在标准设置还是规则注入设置下。
The neural Hawkes process (Mei & Eisner, 2017) is a generative model of irregularly spaced sequences of discrete events. To handle complex domains with many event types, Mei et al. (2020a) further consider a setting in which each event in the sequence updates a deductive database of facts (via domain-specific pattern-matching rules); future events are then conditioned on the database contents. They show how to convert such a symbolic system into a neuro-symbolic continuous-time generative model, in which each database fact and the possible event has a time-varying embedding that is derived from its symbolic provenance. In this paper, we modify both models, replacing their recurrent LSTM-based architectures with flatter attention-based architectures (Vaswani et al., 2017), which are simpler and more parallelizable. This does not appear to hurt our accuracy, which is comparable to or better than that of the original models as well as (where applicable) previous attention-based methods (Zuo et al., 2020; Zhang et al., 2020a).
研究动机与目标
- 开发一种比基于循环神经网络(RNN)的模型更高效、更具可扩展性的替代方案,用于连续时间事件序列建模。
- 通过引入连续时间位置编码,将Transformer架构扩展至处理不规则时间间隔的事件。
- 通过NDTT框架将领域特定的逻辑规则与基于注意力的模型相结合,以提升可解释性和性能。
- 证明自注意力机制在低数据场景和复杂事件动态下,能够匹配或超越RNN及先前基于注意力的模型的性能。
提出的方法
- 使用连续时间位置编码,使时间t处的查询向量能够关注过去事件,同时尊重其时间间隔。
- 通过包含时间特异性位置信息的查询向量,对所有先前事件进行注意力计算,构建时间t处的事件嵌入。
- 以与观测事件相同的方式,为时间t处可能的未来事件生成嵌入,从而实现对瞬时事件强度的预测。
- 提出A-NHP,一种基于Transformer的神经点过程,通过在每个时间t处从零计算嵌入,避免使用参数化衰减函数。
- 通过将A-NHP与神经符号NDTT框架结合,扩展为A-NDTT,其中事件嵌入依赖于符号事实而非直接的事件注意力。
- 在各层中使用残差连接和多头注意力,构建事件序列的深层上下文表征。
实验结果
研究问题
- RQ1自注意力机制是否能在不依赖循环架构的前提下,有效建模不规则时间间隔的事件序列?
- RQ2用Transformer替代LSTM是否能提升连续时间事件建模的性能,特别是在低数据场景下?
- RQ3基于注意力的模型是否能超越或匹配神经符号模型(如NDTT)的性能,同时采用更简单、更浅层的架构?
- RQ4通过NDTT集成领域特定逻辑规则,对基于注意力模型在事件序列生成中的性能有何影响?
- RQ5连续时间位置编码在多大程度上使注意力机制能够在不使用参数化衰减函数的情况下建模时间动态?
主要发现
- 在RoboCup和IPTV数据集上,A-NHP在对数似然度和事件类型预测方面显著优于原始NHP模型(p < 0.05,配对置换检验)。
- A-NDTT模型在性能上与原始NDTT模型相当,但采用更简单、更浅层的架构,表明在此特定基于规则的设定下,注意力机制并未带来显著性能提升。
- 在IPTV数据集上,规则注入和注意力机制各自独立提升了NHP的对数似然度并降低了事件类型预测误差,两者结合效果最佳。
- 基于注意力的模型在合成数据集和真实世界数据集(包括具有复杂时间动态的数据集)上,性能优于或与先前最先进基于Transformer的模型持平。
- 该方法通过在每个时间t处利用过去事件和时间特异性查询向量的注意力机制,从零计算嵌入,成功消除了对任意参数化衰减函数的依赖。
- 由于采用非循环的自注意力机制,该模型在训练期间可并行计算对数似然度,而无需像自回归RNN那样逐序列处理。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。