[论文解读] Decoupled Learning for Factorial Marked Temporal Point Processes
本文提出了一种用于因子标记时间点过程的解耦学习框架,其中事件通过多个离散标记(例如职位和公司)进行建模。通过将问题重新表述为逻辑回归并应用稀疏组正则化,该方法高效地学习事件强度函数,在LinkedIn和ICU数据集上相比耦合或单标记模型显著降低了计算复杂度并提高了预测准确性。
This paper introduces the factorial marked temporal point process model and presents efficient learning methods. In conventional (multi-dimensional) marked temporal point process models, event is often encoded by a single discrete variable i.e. a marker. In this paper, we describe the factorial marked point processes whereby time-stamped event is factored into multiple markers. Accordingly the size of the infectivity matrix modeling the effect between pairwise markers is in power order w.r.t. the number of the discrete marker space. We propose a decoupled learning method with two learning procedures: i) directly solving the model based on two techniques: Alternating Direction Method of Multipliers and Fast Iterative Shrinkage-Thresholding Algorithm; ii) involving a reformulation that transforms the original problem into a Logistic Regression model for more efficient learning. Moreover, a sparse group regularizer is added to identify the key profile features and event labels. Empirical results on real world datasets demonstrate the efficiency of our decoupled and reformulated method. The source code is available online.
研究动机与目标
- 为解决在时间点过程中建模多标记事件时出现的计算爆炸问题,其中传染性矩阵大小随标记空间呈指数增长。
- 开发一种高效的因子标记时间点过程学习方法,实现从历史序列中联合预测多个事件标记(例如职位和公司)。
- 通过引入稀疏组正则化,提升模型可解释性并实现特征选择,以识别关键的个人特征和事件标签。
- 在真实世界数据集上展示解耦学习的有效性,包括LinkedIn职业发展轨迹和MIMIC-II ICU状态转换预测。
提出的方法
- 提出一种解耦学习方法,将联合标记空间分解为独立组件,将传染性矩阵的复杂度从 O(|C|×|P|×|T|) 降低至 O(|C|+|P|+|T|)。
- 采用交替方向乘子法(ADMM)和快速迭代收缩阈值算法(FISTA)直接求解正则化优化问题。
- 将原始判别目标重新表述为逻辑回归框架,通过标准求解器实现更快、更可扩展的学习。
- 应用结合 ℓ₁ 和组套索惩罚的稀疏组正则化器,以在个体特征和标记组之间同时促进稀疏性。
- 使用相互校正过程(MCP)建模强度函数,捕捉事件发生后的抑制效应,反映现实世界动态(如找到新工作后求职意愿降低)。
- 利用事件历史和个体层面的档案信息,预测下一次事件的标记,包括多个标签的联合预测(例如职位、公司、持续时间、状态转换)。
实验结果
研究问题
- RQ1与耦合模型相比,解耦学习是否能显著降低因子标记时间点过程的计算负担?
- RQ2将学习目标重新表述为逻辑回归框架是否能提升训练效率和预测性能?
- RQ3稀疏组正则化器在识别相关个人特征和事件标记方面是否有效?
- RQ4相互校正过程(MCP)强度函数是否能更好地捕捉现实世界动态,如事件发生后的抑制效应?
- RQ5模型性能如何随序列长度变化,特别是在长序列与短序列历史中的表现差异?
主要发现
- 在LinkedIn-Career数据集中,解耦模型将状态空间从 2280 (C×P×T) 降低至 71 (C+P+T),由于初始状态空间更大,性能提升幅度显著高于ICU数据集(从24降至11)。
- 解耦MCP模型在LinkedIn上对未来持续时间预测的MSE为2.934(对比RMTPP的9.625),在ICU上为4.272(对比RMTPP的14.602),显示出更优的回归性能。
- 稀疏组正则化器在LinkedIn职业预测任务中将准确率提升最高达3.0%(例如,稀疏组正则化下为60.13%,无正则化为56.99%),在ICU状态转换预测中提升1.4%(76.98% vs. 73.45%)。
- 解耦MCP模型在长序列预测中优势更明显,表明其更有效地利用了历史事件信息。
- 特征分析显示,'engineer'等标记具有均匀的高影响力,而'director'仅在高层职位(如CEO、创始人)中表现出强影响力,反映了现实的职业发展轨迹。
- MCP强度函数始终优于其他形式,验证了事件发生会抑制未来发生可能性的假设,且历史信息会影响未来状态转换。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。