Skip to main content
QUICK REVIEW

[論文レビュー] An Improved Algorithm for Bipartite Correlation Clustering

Nir Ailon, Noa Avigdor-Elgrabli|arXiv (Cornell University)|Dec 14, 2010
Data Management and Algorithms参考文献 15被引用数 5
ひとこと要約

本稿では、大規模な凸計画を解かずに4-近似を得る、二部相関クラスタリングのための新しい組み合わせ的アルゴリズム、PivotBiClusterを提示する。従来の11-近似因子を改善し、修正された線形計画(LP)解析を用いた確率的ピボット手法を採用することで、二部グラフの効率的かつ証明可能な近似クラスタリングを実現する。

ABSTRACT

Bipartite Correlation clustering is the problem of generating a set of disjoint bi-cliques on a set of nodes while minimizing the symmetric difference to a bipartite input graph. The number or size of the output clusters is not constrained in any way. The best known approximation algorithm for this problem gives a factor of 11. This result and all previous ones involve solving large linear or semi-definite programs which become prohibitive even for modestly sized tasks. In this paper we present an improved factor 4 approximation algorithm to this problem using a simple combinatorial algorithm which does not require solving large convex programs. The analysis extends a method developed by Ailon, Charikar and Alantha in 2008, where a randomized pivoting algorithm was analyzed for obtaining a 3-approximation algorithm for Correlation Clustering, which is the same problem on graphs (not bipartite). The analysis for Correlation Clustering there required defining events for structures containing 3 vertices and using the probability of these events to produce a feasible solution to a dual of a certain natural LP bounding the optimal cost. It is tempting here to use sets of 4 vertices, which are the smallest structures for which contradictions arise for Bipartite Correlation Clustering. This simple idea, however, appears to be evasive. We show that, by modifying the LP, we can analyze algorithms which take into consideration subgraph structures of unbounded size. We believe our techniques are interesting in their own right, and may be used for other problems as well.

研究の動機と目的

  • 大規模な凸計画を解かずに、より効率的で実用的な二部相関クラスタリングの近似アルゴリズムを開発すること。
  • 後に誤りであることが判明した以前の4-近似の主張を補正し、正しいかつ証明可能な最適性を有するアルゴリズムを提供すること。
  • 相関クラスタリングで用いられる確率的ピボット技術を、修正されたLP解析を用いて二部設定に拡張すること。
  • エッジ数に線形時間で実行される、単純な組み合わせ的アルゴリズムにより、定数因子近似を達成すること。
  • 未限界部分グラフ構造の新たな解析を通じて、デランドマイズの道筋とより広範な適用可能性を提供すること。

提案手法

  • エッジ密度に基づきクラスタ代表を選び、確率的にノードをマージまたは分離する、確率的ピボット手法であるPivotBiClusterを導入する。
  • 最適コストを上限づけるために、双対変数β(T)とβ(𝑇̄)を定義する修正された線形計画(LP)を用いる。これにより、未限界部分グラフ構造の解析が可能になる。
  • イベントX_TおよびX_𝑇̄に条件づけた確率的解析を適用し、クラスタサイズ比とエッジ/非エッジ数に基づいて期待コスト寄与を計算する。
  • 弱双対性を用いて、PivotBiClusterの期待コストが双対変数の和の4倍以内であることを示し、これが最適コストの4倍以内であることを保証する。
  • クラスタサイズの関係に関するケース解析を通じて期待コストの上限を導出する。これには、入力と出力のバイクラスタ間の対称差を用いる。
  • 2008年の相関クラスタリング手法を、4ノード構造の解析と双対LPフレームワークの適応を通じて、二部ケースに拡張する。

実験結果

リサーチクエスチョン

  • RQ1大規模な凸計画を解かずに、単純な組み合わせ的アルゴリズムが二部相関クラスタリングにおいて4-近似を達成できるか?
  • RQ2以前に主張された4-近似アルゴリズムはなぜ失敗するのか?その欠陥はどのように是正できるか?
  • RQ3標準的な相関クラスタリングで用いられる確率的ピボット手法を、証明可能な保証のもとで二部設定に適応できるか?
  • RQ4LP定式化を修正することで、未限界部分グラフ構造を用いたアルゴリズムの解析は可能か?
  • RQ5組み合わせ的技法やLPラウンディングを用いて、4を超える近似因子を改善できるか?

主な発見

  • 提案されたPivotBiClusterアルゴリズムは、二部相関クラスタリングにおいて4-近似を達成し、従来の最高因子11を改善する。
  • アルゴリズムは大規模な凸計画を解かず、エッジ数に線形時間で実行されるため、大規模グラフにおいてもスケーラブルである。
  • 修正されたLP双対と弱双対性を用いた解析により、PivotBiClusterの期待コストが最適コストの4倍以内であることが証明される。
  • 双対変数の再定義とクラスタサイズ比に条件づけた解析により、未限界部分グラフ構造を効果的に扱える。
  • 以前に主張された4-近似アルゴリズムは反例により誤りであることが示され、新たな解析フレームワークの必要性が裏付けられる。
  • このアプローチは、デランドマイズの道筋と、類似した構造制約を持つ他のクラスタリング問題への潜在的な拡張を切り開く。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。