Skip to main content
QUICK REVIEW

[论文解读] Distributed Submodular Maximization

Baharan Mirzasoleiman, Amin Karbasi|arXiv (Cornell University)|Nov 3, 2014
Privacy-Preserving Technologies in Data参考文献 47被引用 3
一句话总结

本文提出GreeDi,一种用于子模函数最大化的分布式算法,可在MapReduce环境中实现可扩展的、接近最优的解决方案。通过数据分区并应用具有可证明近似保证的两阶段贪心式过程,GreeDi在大规模数据集(如数千万个点的示例聚类和稀疏高斯过程)上实现了集中式贪心方法98%的性能。

ABSTRACT

Many large-scale machine learning problems--clustering, non-parametric learning, kernel machines, etc.--require selecting a small yet representative subset from a large dataset. Such problems can often be reduced to maximizing a submodular set function subject to various constraints. Classical approaches to submodular optimization require centralized access to the full dataset, which is impractical for truly large-scale problems. In this paper, we consider the problem of submodular function maximization in a distributed fashion. We develop a simple, two-stage protocol GreeDi, that is easily implemented using MapReduce style computations. We theoretically analyze our approach, and show that under certain natural conditions, performance close to the centralized approach can be achieved. We begin with monotone submodular maximization subject to a cardinality constraint, and then extend this approach to obtain approximation guarantees for (not necessarily monotone) submodular maximization subject to more general constraints including matroid or knapsack constraints. In our extensive experiments, we demonstrate the effectiveness of our approach on several applications, including sparse Gaussian process inference and exemplar based clustering on tens of millions of examples using Hadoop.

研究动机与目标

  • 解决集中式子模优化在大规模机器学习数据集上的可扩展性限制。
  • 开发一种分布式算法,在基数、拟阵和背包约束下仍保持强大的理论近似保证。
  • 实现在Hadoop和MapReduce风格系统上的实际部署,适用于示例聚类和主动集选择等现实世界应用。
  • 理论分析表明,在自然数据分区和邻域条件下,GreeDi的性能接近集中式贪心算法。
  • 在包含数千万个点的数据集上展示其实证有效性,实现接近最优的结果,且通信量极低。

提出的方法

  • 使用随机分配将数据集划分为m个互不相交的子集,以支持并行处理。
  • 在每个子集上独立应用黑箱子模优化算法,计算局部解。
  • 采用两阶段协议:第一阶段,在每台机器上计算局部解;第二阶段,使用全局近似策略组合并优化结果。
  • 利用局部可替换性和邻域密度的概念,确保各分区中的可行解接近全局最优。
  • 通过邻域大小的概率界以及约束下解的可行性,证明近似保证。
  • 通过采样和分区技术,将框架扩展至处理非单调子模函数以及拟阵和背包等一般约束。

实验结果

研究问题

  • RQ1在基数约束下,分布式算法能否实现与集中式子模最大化相媲美近似保证?
  • RQ2在MapReduce环境中,如何在不牺牲理论性能保证的前提下,有效并行化子模最大化?
  • RQ3在数据分区和邻域结构上需满足何种条件,才能确保局部解接近全局最优?
  • RQ4该方法能否扩展至非单调子模函数以及拟阵和背包等复杂约束?
  • RQ5该算法在真实世界机器学习任务中,面对大规模数据集时,实际可扩展性如何?

主要发现

  • 在包含数千万个点的示例聚类数据集上,GreeDi在示例聚类任务中实现了集中式贪心算法98%的目标值。
  • 在稀疏高斯过程的主动集选择中,该方法达到了集中式解质量的97%。
  • 在图割寻找任务中,算法实现了最优值的90%,展示了在多样化应用中的鲁棒性。
  • 理论分析证明,在局部可替换性和足够邻域密度条件下,算法保持常数因子近似保证。
  • 算法对随机数据分区具有鲁棒性,高概率下可确保至少一个分区包含接近最优的解。
  • 该方法在数据规模增大时仍能高效扩展,且通信量极少,适用于Hadoop等大规模分布式系统。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。