Skip to main content
QUICK REVIEW

[论文解读] Best of Both Worlds: Practical and Theoretically Optimal Submodular Maximization in Parallel

Yixin Chen, Tonmoy Dey|arXiv (Cornell University)|Nov 15, 2021
Complexity and Algorithms in Graphs被引用 8
一句话总结

本文提出 LS+PGB,一种新颖的并行算法,用于在基数约束下进行单调子模最大化,其在查询复杂度(期望为 O(n))、自适应性(O(log n))和近似比(接近 1−1/e)方面实现了理论最优,同时在实践中优于先前的最先进方法 FAST。该方法结合了预处理步骤(LinearSeq)和并行阈值处理过程(ThresholdSeq),在六种不同的子模目标函数上同时实现了强大的理论保证和卓越的实验性能。

ABSTRACT

For the problem of maximizing a monotone, submodular function with respect to a cardinality constraint $k$ on a ground set of size $n$, we provide an algorithm that achieves the state-of-the-art in both its empirical performance and its theoretical properties, in terms of adaptive complexity, query complexity, and approximation ratio; that is, it obtains, with high probability, query complexity of $O(n)$ in expectation, adaptivity of $O(\log(n))$, and approximation ratio of nearly $1-1/e$. The main algorithm is assembled from two components which may be of independent interest. The first component of our algorithm, LINEARSEQ, is useful as a preprocessing algorithm to improve the query complexity of many algorithms. Moreover, a variant of LINEARSEQ is shown to have adaptive complexity of $O( \log (n / k) )$ which is smaller than that of any previous algorithm in the literature. The second component is a parallelizable thresholding procedure THRESHOLDSEQ for adding elements with gain above a constant threshold. Finally, we demonstrate that our main algorithm empirically outperforms, in terms of runtime, adaptive rounds, total queries, and objective values, the previous state-of-the-art algorithm FAST in a comprehensive evaluation with six submodular objective functions.

研究动机与目标

  • 解决理论上最优但不实用的子模最大化算法与实际中虽有效但理论性能较弱的算法(如 FAST)之间的差距。
  • 设计一种并行算法,同时实现最优的理论复杂度(查询、自适应性)和优越的实验性能。
  • 为大规模应用(如图像摘要、网络监控和影响力最大化)提供高效、可扩展的子模优化方法。
  • 降低基于采样的算法中的常数因子,这些因子虽然理论保证强大,却阻碍了实际部署。
  • 证明在子模最大化中,理论最优性与实际效率并非相互排斥。

提出的方法

  • 该算法结合了两个组件:LinearSeq 是一种预处理过程,可提升查询效率并实现 O(log(n/k)) 的自适应复杂度;ThresholdSeq 是一种可并行的阈值处理过程,通过添加边际增益高于固定阈值的元素来工作。
  • LinearSeq 通过迭代识别并移除低增益元素来减少有效基集大小,从而减少后续所需的查询次数。
  • ThresholdSeq 在并行轮次中运行,每轮评估增益超过固定阈值的元素,确保高质量的添加操作,同时保持低自适应性。
  • 整体算法 LS+PGB 整合了 LinearSeq 和 ThresholdSeq,以在理论保证与实际效率之间取得平衡,实现接近最优的近似比,同时保持低查询和自适应复杂度。
  • 该方法借鉴了先前工作中自适应排序技术,但进行了优化,避免了早期版本中二次方查询复杂度的问题,从而实现了可扩展性。
  • 理论分析表明,LS+PGB 实现了 O(n) 的期望查询复杂度、O(log n) 的自适应性,以及以高概率成立的 (1−1/e)−ε 近似比。

实验结果

研究问题

  • RQ1能否设计一种算法,使其在查询复杂度、自适应性和近似比方面均达到理论最优,同时适用于大规模应用?
  • RQ2能否在不牺牲理论保证的前提下,降低基于采样的最优算法中的高常数因子?
  • RQ3结合预处理与阈值处理的混合方法是否能同时实现理论最优性和优越的实验性能?
  • RQ4LinearSeq 的自适应复杂度与现有方法相比如何,特别是在小 k 值情况下?
  • RQ5在多种真实世界子模目标函数中,LS+PGB 在运行时间、总查询次数和自适应性方面相较于 FAST 的优势有多大?

主要发现

  • LS+PGB 实现了 O(n) 的期望查询复杂度、O(log n) 的自适应性,以及接近 1−1/e 的近似比,且以高概率成立,与最佳理论边界完全一致。
  • LinearSeq 组件实现了 O(log(n/k)) 的自适应复杂度,低于文献中任何先前算法的复杂度。
  • 在实验评估中,LS+PGB 在所有指标上均优于 FAST:其目标值更高(在 MaxCover 上最多好 6%,在 TwitterSumm 上好 5%),在 MaxCover 和 TwitterSumm 上使用的查询次数少于一半,平均运行时间也少于一半。
  • 在 TwitterSumm 应用中,LS+PGB 比 FAST 快逾 4 倍,且在 1–64 个线程的扩展中,平均速度提升了 10 倍。
  • 在 MaxCover 和 TwitterSumm 上,对于较大的 k 值,LS+PGB 的自适应轮次数比 FAST 减少了 50%以上,显示出更强的可并行性。
  • 与 Fahrbach 等人提出的 BinarySearchMaximization 相比,LS+PGB 使用的查询次数约为其十分之一,速度也快了近一个数量级,尽管两者均具有强大的理论保证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。