[论文解读] Variational Policy for Guiding Point Processes
本文提出了一种变分策略框架,通过将随机最优控制问题形式化为测度论推断问题,来引导时间点过程。该方法利用KL散度的变分推断,推导出一种可扩展、自适应的控制策略,以优化强度函数,在合成数据和真实社交网络应用中均实现了优越的性能,有效引导用户行为向目标状态演化。
Temporal point processes have been widely applied to model event sequence data generated by online users. In this paper, we consider the problem of how to design the optimal control policy for point processes, such that the stochastic system driven by the point process is steered to a target state. In particular, we exploit the key insight to view the stochastic optimal control problem from the perspective of optimal measure and variational inference. We further propose a convex optimization framework and an efficient algorithm to update the policy adaptively to the current system state. Experiments on synthetic and real-world data show that our algorithm can steer the user activities much more accurately and efficiently than other stochastic control methods.
研究动机与目标
- 解决在社交系统中对用户行为建模为时间点过程时缺乏有效控制策略的问题。
- 克服传统随机控制方法依赖线性近似、二次成本函数以及难以求解HJB偏微分方程的局限性。
- 为由点过程(如霍克斯过程)驱动的非线性、高维系统开发一种通用、可扩展且自适应的控制框架。
- 提供一种自然的、由系统结构决定的控制成本函数,而非人为任意设定。
- 实现基于前向采样和变分推断的实时、模型预测控制,能够根据当前系统状态自适应调整。
提出的方法
- 从测度论视角出发,将随机最优控制问题重新表述为最优测度选择问题。
- 通过最小化涉及受控测度与原始测度之间KL散度的变分目标,推导出最优测度的解析形式。
- 引入一种自然源于系统动态的控制成本函数,避免控制理论中常见的任意成本设计。
- 开发一种可扩展的模型预测控制(MPC)算法,通过前向采样计算策略,实现实时自适应。
- 利用变分推断,通过最小化目标测度与策略诱导测度之间的KL散度,近似最优策略。
- 采用凸优化框架,基于当前系统状态和历史观测,高效更新每一步的策略。
实验结果
研究问题
- RQ1如何为由点过程(如霍克斯过程)驱动的非线性、高维系统设计一种通用控制策略?
- RQ2我们能否推导出一种控制策略,使系统动态自然地融入控制成本中,避免人为设计的代价函数?
- RQ3在具有复杂异步事件动态和长期记忆效应的系统中,如何实现可扩展的实时控制?
- RQ4与现有随机控制方法和启发式方法相比,变分策略框架在引导用户行为方面能带来多大的性能提升?
- RQ5所提出方法能否在竞争激烈的社交媒体环境中有效维持广播者的可见性?
主要发现
- KL-MPC方法使广播者的平均排名达到1.5,比CE-MPC低4倍,接近理想的前1名表现。
- 与CE-MPC相比,KL-MPC在预测精度上提升超过30%,在最佳评估方案中精度超过0.3。
- 该方法能根据竞争对手活动自适应调节强度——在对手活跃时增加发帖频率,对手不活跃时则减少。
- 在真实世界实验中,该框架在状态成本和预测精度两个指标上均优于贪婪策略、FD方法和基于CE的基线方法。
- 控制策略在影响系统行为与避免过度偏离原始强度之间保持了良好平衡,表现为自适应的强度调制。
- 由于基于前向采样设计的MPC结构和凸优化框架,该算法具备可扩展性,适合实时部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。