[论文解读] Distributed Coverage Maximization via Sketching
本文提出了一种基于自适应采样技术的分布式算法,用于覆盖最大化问题,仅通过四轮通信即可实现最优近似保证(k-覆盖问题为1−1/e,λ-异常值集合覆盖问题为log(1/λ)),具备与基集大小无关的次线性空间复杂度和接近最优的通信复杂度。该方法可高效实现大规模特征选择,在理论和实践上均优于以往工作,使用比输入数据小30至600倍的压缩数据结构,实现了接近最先进水平的性能。
Coverage problems are central in optimization and have a wide range of applications in data mining and machine learning. While several distributed algorithms have been developed for coverage problems, the existing methods suffer from several limitations, e.g., they all achieve either suboptimal approximation guarantees or suboptimal space and memory complexities. In addition, previous algorithms developed for submodular maximization assume oracle access, and ignore the computational complexity of communicating large subsets or computing the size of the union of the subsets in this subfamily. In this paper, we develop an improved distributed algorithm for the $k$-cover and the set cover with $λ$ outliers problems, with almost optimal approximation guarantees, almost optimal memory complexity, and linear communication complexity running in only four rounds of computation. Finally, we perform an extensive empirical study of our algorithms on a number of publicly available real data sets, and show that using sketches of size $30$ to $600$ times smaller than the input, one can solve the coverage maximization problem with quality very close to that of the state-of-the-art single-machine algorithm.
研究动机与目标
- 解决以往分布式子模最大化算法在覆盖问题中面临的通信开销高、空间复杂度差或近似保证次优等局限性。
- 设计一种用于k-覆盖和带λ个异常值的集合覆盖问题的分布式算法,实现最优近似比,同时最小化通信轮数和空间使用量。
- 通过引入基于压缩的新型方法,克服在大规模数据集中使用值预言机访问方式的低效性,避免在机器之间传输完整子集。
- 支持在MapReduce和RAM模型中的实际部署,适用于包含海量元素和基集的现实工作负载。
- 在大规模特征选择任务中展示其适用性,证明仅使用极小的压缩数据结构即可获得高质量结果。
提出的方法
- 提出一种自适应采样与压缩技术,实现无需传输完整集合即可高效计算覆盖函数的分布式计算。
- 利用输入集合的随机压缩表示来估计并集大小,从而在保持近似保证的同时降低空间和通信复杂度。
- 设计一种四轮通信的分布式算法,结合压缩构建、本地计算与全局聚合,以计算近似最优解。
- 在MapReduce和RAM模型中实现该算法,支持随机访问与分布式哈希表,以实现可扩展的数据处理。
- 通过调整压缩与近似机制,将该框架扩展至加权覆盖和支配集问题。
- 利用压缩方法实现高效特征选择,将特征对建模为元素,将特征建模为集合,以最大化覆盖度。
实验结果
研究问题
- RQ1我们能否设计一种用于k-覆盖和带λ个异常值的集合覆盖问题的分布式算法,实现最优近似比,同时最小化通信开销与空间复杂度?
- RQ2是否可以使用基于压缩的方法替代昂贵的值预言机访问,避免在机器之间传输大型子集?
- RQ3自适应压缩技术能否仅通过四轮通信实现接近最优的性能,而无需像以往算法那样采用对数轮次的通信方式?
- RQ4在保持与单机贪心算法相近的解质量的前提下,压缩数据结构可以小到何种程度?
- RQ5所提出的压缩框架能否有效应用于高维数据的现实世界特征选择任务?
主要发现
- 所提算法在k-覆盖问题中实现了1−1/e的最优近似比,在λ-异常值集合覆盖问题中实现了log(1/λ)的最优近似比,与理论上限完全一致。
- 当压缩数据大小仅为输入大小的0.1%至10%时,该算法在livej-2和planted-A等真实数据集上实现了单机贪心算法96%至99.9%的性能。
- 在livej-2数据集上,0.8%的压缩数据规模即可达到与10%采样相当的性能,0.3%规模时仅损失1%。
- 在news20数据集上的特征选择任务中,使用k=2500个特征时,该算法实现了91.2%的预测准确率,优于以往的分布式方法,并达到或超越了当前最先进水平。
- 该算法仅需四轮通信,显著降低了与以往对数轮次方法相比的延迟。
- 空间复杂度为O(n),通信复杂度为Õ(n),与基集大小m无关,因此可扩展至包含海量元素的数据集。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。