[论文解读] Fast and Flexible Temporal Point Processes with Triangular Maps
本文提出TriTPP,一种新型非递归时间点过程,利用归一化流中的三角映射实现完全并行的似然计算与采样。通过使用可逆、自回归变换重新参数化经典时间点过程,TriTPP在实现RNN级别灵活性的同时,采样速度提升数个数量级,从而在真实世界数据集上实现了连续时间马尔可夫跳跃过程的高效变分推断。
Temporal point process (TPP) models combined with recurrent neural networks provide a powerful framework for modeling continuous-time event data. While such models are flexible, they are inherently sequential and therefore cannot benefit from the parallelism of modern hardware. By exploiting the recent developments in the field of normalizing flows, we design TriTPP -- a new class of non-recurrent TPP models, where both sampling and likelihood computation can be done in parallel. TriTPP matches the flexibility of RNN-based methods but permits orders of magnitude faster sampling. This enables us to use the new model for variational inference in continuous-time discrete-state systems. We demonstrate the advantages of the proposed framework on synthetic and real-world datasets.
研究动机与目标
- 解决基于RNN的时间点过程的序列性问题,该问题限制了并行化和采样速度。
- 开发一种非递归的TPP框架,在保持基于RNN模型表达能力的同时,实现并行推理与生成。
- 通过为不可微的基于采样的损失推导一种松弛,实现对隐藏半马尔可夫模型的可微变分推断。
- 证明所提出的模型在合成数据和真实世界事件序列建模任务中,性能可匹配或超越基于RNN和经典TPP的模型。
提出的方法
- 该方法使用三角映射对时间点过程进行重参数化——即利用可逆、自回归变换,实现并行采样与似然评估。
- 构建一个基于流的变换,由多个组件组成:时间扭曲映射(Λ)、基础变换(D)、耦合流(Φ₁)、双射序列(B₁–B₄)、第二重耦合流(Φ₂)以及最终双射(C),形成完整的映射 F = C ∘ Φ₂ ∘ B₄ ∘ B₃ ∘ B₂ ∘ B₁ ∘ Φ₁ ∘ D ∘ Λ。
- 似然通过变量变换公式计算,雅可比行列式为各组件偏导数的乘积,从而实现高效的梯度计算。
- 在变换空间中使用齐次泊松过程作为基分布,补偿函数 Λ*(t) 将事件时间映射为单位强度泊松过程。
- 推导出一种基于采样的损失的可微松弛,以支持在隐藏半马尔可夫模型中进行端到端的变分推断训练。
- 该框架支持密度估计与变分推断,通过最大似然进行训练,后验分布通过摊销推断估计。
实验结果
研究问题
- RQ1我们能否设计一种非递归时间点过程,使其在保持RNN模型灵活性的同时,实现完全并行的采样与似然计算?
- RQ2能否有效将归一化流中的三角映射适配于建模具有可变长度、连续时间事件序列的时间点过程?
- RQ3所提出的框架能否支持在连续时间离散状态系统(如马尔可夫跳跃过程)中的可微变分推断?
- RQ4在真实世界数据上,TriTPP在似然、采样速度和分布匹配方面的性能,与基于RNN和经典TPP的模型相比如何?
主要发现
- TriTPP的采样速度比基于RNN的模型快数个数量级,能够高效生成长序列。
- 在Twitter数据集上,TriTPP在序列长度分布匹配上达到Wasserstein距离0.17,优于霍克斯过程(WD = 0.50),并接近RNN模型的性能(WD = 0.10)。
- 在服务器日志数据的变分推断中,TriTPP成功将序列分割为高事件率与低事件率状态,与MCMC基线结果一致。
- 模型在多个随机种子下均稳定收敛,后验轨迹与训练损失曲线一致,表明其具有强鲁棒性。
- 在所有基准数据集上,TriTPP的负对数似然(NLL)性能与基于RNN的模型相当或更优,同时支持并行推理。
- 基于采样损失的可微松弛使端到端变分推断训练成为可能,从而可将该模型应用于复杂连续时间系统。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。