Skip to main content
QUICK REVIEW

[論文レビュー] Randomized Composable Core-sets for Distributed Submodular Maximization

Vahab Mirrokni, Morteza Zadimoghaddam|arXiv (Cornell University)|Jun 22, 2015
Complexity and Algorithms in Graphs参考文献 18被引用数 10
ひとこと要約

本稿は、データをマシン間でランダムに分割し、各マシンでグリーディー法によりコアセットを構築する分散サブモジュラ最大化のためのランダム化可能コアセットを導入する。基数制約下での単調サブモジュラ関数に対して1/3近似を得るが、非ランダム化コアセットのΩ(log k / √k)の不可能性境界を著しく上回り、O(n)通信量の2ラウンドMapReduceアルゴリズムで定数因子近似を達成するという、初めての成果である。

ABSTRACT

An effective technique for solving optimization problems over massive data sets is to partition the data into smaller pieces, solve the problem on each piece and compute a representative solution from it, and finally obtain a solution inside the union of the representative solutions for all pieces. This technique can be captured via the concept of {\em composable core-sets}, and has been recently applied to solve diversity maximization problems as well as several clustering problems. However, for coverage and submodular maximization problems, impossibility bounds are known for this technique \cite{IMMM14}. In this paper, we focus on efficient construction of a randomized variant of composable core-sets where the above idea is applied on a {\em random clustering} of the data. We employ this technique for the coverage, monotone and non-monotone submodular maximization problems. Our results significantly improve upon the hardness results for non-randomized core-sets, and imply improved results for submodular maximization in a distributed and streaming settings. In summary, we show that a simple greedy algorithm results in a $1/3$-approximate randomized composable core-set for submodular maximization under a cardinality constraint. This is in contrast to a known $O({\log k\over \sqrt{k}})$ impossibility result for (non-randomized) composable core-set. Our result also extends to non-monotone submodular functions, and leads to the first 2-round MapReduce-based constant-factor approximation algorithm with $O(n)$ total communication complexity for either monotone or non-monotone functions. Finally, using an improved analysis technique and a new algorithm $\mathsf{PseudoGreedy}$, we present an improved $0.545$-approximation algorithm for monotone submodular maximization, which is in turn the first MapReduce-based algorithm beating factor $1/2$ in a constant number of rounds.

研究の動機と目的

  • 基数制約下でのサブモジュラ最大化における非ランダム化可能コアセットの既知の不可能性境界を克服すること。
  • 少数のラウンドで定数因子近似を達成する効率的な分散アルゴリズムを設計すること。
  • 機械学習分野で広く使われる経験的手法(ランダムクラスタリングとグリーディーなコアセット構築)の理論的基盤を提供すること。
  • 単調および非単調サブモジュラ関数の両方に対してアプローチを拡張し、MapReduceおよびストリーミングモデルで改善された近似因子を達成すること。

提案手法

  • グランドセットをm個のクラスタにランダムに分割し、各要素をC個のランダムに選ばれたマシンに割り当てることで、重複度Cのランダムクラスタリングを形成する。
  • 各マシンで、局所データからマージナルゲインが最大のアイテムを選択するグリーディー法を適用し、コアセットS'ℓを構築する。
  • ランダムサンプリングステップを導入:各マシンは自身のコアセットS'ℓからサイズk'のランダムサブセットを出力することで、通信量を削減し、カバレッジを保証する。
  • ランダムクラスタリングおよびサンプリングによる最適解からの損失を制限することで、出力集合の和集合の期待値を分析する。
  • サブモジュラリティおよびリターンの逓減性を活用し、マージナルゲインおよびコアセット品質の濃度バインディングを導出する。
  • MapReduceにおける単調サブモジュラ最大化の近似因子を0.545に向上させるための新アルゴリズムPseudoGreedyを導入する。

実験結果

リサーチクエスチョン

  • RQ1ランダム化可能コアセットは、サブモジュラ最大化における非ランダム化可能コアセットのΩ(log k / √k)の不可能性境界を克服できるか?
  • RQ2O(n)の合計通信量を持つ2ラウンドMapReduceモデルにおいて、ランダム化可能コアセットを用いた場合に達成可能な近似因子は何か?
  • RQ3ランダム化可能コアセットフレームワークは、非単調サブモジュラ関数に対しても拡張可能であり、定数因子近似を維持できるか?
  • RQ4ランダムクラスタリングの重複度Cを増加させることで、達成可能な近似因子にどのような影響があるか?
  • RQ5反復的または強化されたコアセット構築を用いることで、マップリダクスにおける単調サブモジュラ最大化で1/2近似の壁を破ることは可能か?

主な発見

  • 本稿は、ランダム化可能コアセットに単純なグリーディー法を適用することで、基数制約下での単調サブモジュラ最大化に対して1/3近似を達成する。
  • 本稿は、単調および非単調サブモジュラ関数の両方に対して、O(n)の合計通信量を持つ2ラウンドMapReduceアルゴリズムで定数因子近似を達成する初の手法を提示する。
  • 単調サブモジュラ最大化において、改善されたPseudoGreedyアルゴリズムにより0.545近似が達成され、定数ラウンド内で1/2の壁を破る。
  • 分析により、出力コアセットの和集合の期待値がΩ(√(k'/k) · f(OPT))であることが示され、k'を適切に選ぶことで定数因子近似が得られる。
  • ランダム化可能コアセットフレームワークは、機械学習分野で経験的に成功している手法(ランダムクラスタリングとグリーディー選択)の理論的裏付けを提供する。
  • 本アプローチは、マトロイド制約を含むより一般的なパッケージ制約へも拡張可能であり、基数制約を超えた幅広い応用可能性を示唆する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。