[论文解读] Scalable Structure Learning for Probabilistic Soft Logic
本文提出了两种可扩展的概率软逻辑(PSL)结构学习方法:一种基于贪心搜索的方法,以及一种新颖的分段伪似然(PPLL)优化方法。PPLL通过实现单次遍历的子句权重优化与并行更新,克服了贪心搜索中迭代权重学习与评分的瓶颈,使运行时间缩短一个数量级,AUC最高提升15%。
Statistical relational frameworks such as Markov logic networks and probabilistic soft logic (PSL) encode model structure with weighted first-order logical clauses. Learning these clauses from data is referred to as structure learning. Structure learning alleviates the manual cost of specifying models. However, this benefit comes with high computational costs; structure learning typically requires an expensive search over the space of clauses which involves repeated optimization of clause weights. In this paper, we propose the first two approaches to structure learning for PSL. We introduce a greedy search-based algorithm and a novel optimization method that trade-off scalability and approximations to the structure learning problem in varying ways. The highly scalable optimization method combines data-driven generation of clauses with a piecewise pseudolikelihood (PPLL) objective that learns model structure by optimizing clause weights only once. We compare both methods across five real-world tasks, showing that PPLL achieves an order of magnitude runtime speedup and AUC gains up to 15% over greedy search.
研究动机与目标
- 为概率软逻辑(PSL)的结构学习问题建立形式化定义,该问题此前缺乏可扩展的方法。
- 解决PSL中结构学习的高计算成本问题,该问题涉及重复的参数估计与模型评分。
- 开发可扩展的、数据驱动的子句生成与优化技术,以减少对迭代权重学习与评分的依赖。
- 在多种真实世界任务中评估所提方法的预测性能与运行时间效率。
- 证明PPLL能够有效扩展至大规模候选子句集合,同时保持或提升预测准确性。
提出的方法
- 提出基于路径约束的子句生成方法,利用关系随机游走从数据中提取有意义的模式与基序,用于候选子句的创建。
- 引入一种基于贪心搜索的方法,通过重复的权重学习与模型评分迭代选择子句。
- 提出分段伪似然(PPLL)目标函数,一种凸代理函数,支持对子句权重进行单次遍历优化。
- 在PPLL中采用并行化优化更新,以加速收敛并提升可扩展性。
- 采用数据驱动的自底向上方法生成候选子句,将搜索空间缩减为语义上有意义的关系模式。
- 通过PPLL目标函数隐式应用L1正则化,以促进模型简洁性与泛化能力。
实验结果
研究问题
- RQ1能否设计一种可扩展的PSL结构学习方法,避免权重学习与模型评分之间的昂贵交替过程?
- RQ2与贪心搜索相比,基于PPLL的优化方法在运行时间与预测准确性方面的表现如何?
- RQ3路径约束的子句生成在多大程度上能提升PSL结构学习中候选子句的质量与相关性?
- RQ4PPLL目标函数能否推广至其他SRL框架(如马尔可夫逻辑网络)?
- RQ5在PSL结构学习中,可扩展性与近似质量之间的权衡如何?PPLL与贪心搜索相比表现如何?
主要发现
- 在包括生物论文推荐与药物相互作用预测在内的多个真实世界任务中,PPLL的AUC相比贪心搜索方法最高提升15%。
- 与贪心搜索相比,PPLL将运行时间缩短了一个数量级,在BookAuthor任务中,200个候选子句的模型训练仅需四分钟,而贪心搜索则接近两天。
- 当候选子句集合增长至200个时,PPLL仍保持计算可行性,而贪心搜索在子句集较小时即变得不可行。
- PPLL目标函数实现了对子句权重的可扩展单次遍历优化,消除了重复参数估计与评分轮次的需求。
- 路径约束的子句生成与PPLL优化相结合,可生成质量更高的模型,具备更好的泛化能力与更快的训练速度。
- 由于其凸性与可微性,PPLL方法可推广至其他SRL框架,包括马尔可夫逻辑网络。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。