Skip to main content
QUICK REVIEW

[論文レビュー] Approximate Clustering with Same-Cluster Queries

Nir Ailon, Anup Bhattacharya|arXiv (Cornell University)|Apr 6, 2017
Data Management and Algorithms参考文献 17被引用数 6
ひとこと要約

本稿では、マージン仮定を必要とせず、同じクラスタ内クエリを僅か $\mathrm{poly}(k/\varepsilon)$ 個のみ使用する、$k$-means問題に対する多項式時間$(1+\varepsilon)$近似アルゴリズムを提示する。この手法は、半教師付きアクティブクラスタリング(SSAC)フレームワーク内での$k$-means++シーディングアルゴリズムの拡張により、定数因子近似を達成し、既知のNP困難性の障壁を回避できることを示している。

ABSTRACT

Ashtiani et al. proposed a Semi-Supervised Active Clustering framework (SSAC), where the learner is allowed to make adaptive queries to a domain expert. The queries are of the kind "do two given points belong to the same optimal cluster?" There are many clustering contexts where such same-cluster queries are feasible. Ashtiani et al. exhibited the power of such queries by showing that any instance of the $k$-means clustering problem, with additional margin assumption, can be solved efficiently if one is allowed $O(k^2 \log{k} + k \log{n})$ same-cluster queries. This is interesting since the $k$-means problem, even with the margin assumption, is $\mathsf{NP}$-hard. In this paper, we extend the work of Ashtiani et al. to the approximation setting showing that a few of such same-cluster queries enables one to get a polynomial-time $(1 + \varepsilon)$-approximation algorithm for the $k$-means problem without any margin assumption on the input dataset. Again, this is interesting since the $k$-means problem is $\mathsf{NP}$-hard to approximate within a factor $(1 + c)$ for a fixed constant $0 < c < 1$. The number of same-cluster queries used is $ extrm{poly}(k/\varepsilon)$ which is independent of the size $n$ of the dataset. Our algorithm is based on the $D^2$-sampling technique. We also give a conditional lower bound on the number of same-cluster queries showing that if the Exponential Time Hypothesis (ETH) holds, then any such efficient query algorithm needs to make $Ω\left(\frac{k}{poly \log k} ight)$ same-cluster queries. Our algorithm can be extended for the case when the oracle is faulty. Another result we show with respect to the $k$-means++ seeding algorithm is that a small modification to the $k$-means++ seeding algorithm within the SSAC framework converts it to a constant factor approximation algorithm instead of the well known $O(\log{k})$-approximation algorithm.

研究の動機と目的

  • 同じクラスタ内クエリが許可されるSSACフレームワーク下での$k$-means問題の効率的近似アルゴリズムの設計。
  • 従来のアルゴリズムが効率的解を得るために必要としていたマージン仮定の不要化。
  • 少数の適応的同じクラスタ内クエリによって、$k$-means++アルゴリズムを定数因子近似アルゴリズムに変換できることの示唆。
  • 指数時間仮説(ETH)のもとでの、必要なクエリ数に関する条件付き下界の確立。
  • 誤差確率が有界な場合のノイズのあるまたは故障のあるオラクルに対しても対応できるフレームワークの拡張。

提案手法

  • アルゴリズムは、同じクラスタ内クエリによるクラスタ割り当ての改善を伴う、$D^2$-サンプリング($k$-means++)を基本のシーディング手法として使用する。
  • サブルーチンであるPartitionSampleは、$D^2$-サンプリングを用いて、各パーティションが少なくとも$\Omega(k/\varepsilon)$のサイズを持つように、サンプル点をクラスタに分割する。
  • IsCoveredサブルーチンは、多数決投票を用いて、クラスタが既存のセンターによってカバーされているかどうかを同定し、チェルノフ不等式を用いて確率的正しさを保証する。
  • アルゴリズムは、未カバーのクラスタを検出するためにオラクルを適応的にクエリし、中心選択を繰り返し改善することで、すべてのクラスタがカバーされるまで反復する。
  • 故障のあるオラクルの場合、誤差耐性のある多数決投票と集中不等式を用いて、高確率での正しさを保証する。
  • クエリ複雑度は、非還元可能なデータセットでは$O(k^7/\varepsilon^8)$、一般には$O(k^{15}/\varepsilon^8)$で抑えられ、$n$に依存しない。

実験結果

リサーチクエスチョン

  • RQ1同じクラスタ内クエリによって、マージン仮定なしに多項式時間$(1+\varepsilon)$-近似が$k$-means問題に対して達成可能か?
  • RQ2$k$-means++アルゴリズムをSSACフレームワーク内で変更することで、$O(\log k)$ではなく定数因子近似が達成可能か?
  • RQ3指数時間仮説(ETH)のもとで、効率的近似を達成するために必要な同じクラスタ内クエリの最小数は何か?
  • RQ4誤差確率が有界なノイズのあるオラクル応答に対しても、アルゴリズムが耐性を持つことができるか?
  • RQ5SSACフレームワークは、クラスタリング問題におけるNP困難性を回避する実用的な道筋を提供できるか?

主な発見

  • 本稿では、データセットサイズ$n$に依存せず、同様のクラスタ内クエリを僅か$\mathrm{poly}(k/\varepsilon)$回使用する多項式時間$(1+\varepsilon)$-近似アルゴリズムを提示する。
  • SSACフレームワーク内での$k$-means++の変更により、標準的な$O(\log k)$-近似保証を上回る定数因子近似を達成する。
  • 条件付き下界により、ETHのもとでは、任意の効率的アルゴリズムが$\Omega(k / \mathrm{poly}(\log k))$の同じクラスタ内クエリを必要とする。
  • チェルノフ不等式を用いたクエリ結果の分析により、カバー済みおよび未カバーのクラスタを確率$1 - \frac{1}{16k}$以上で正しく検出できる。
  • 誤差確率$q < 1/2$の故障のあるオラクルに対しても、多数決投票と集中不等式を用いることで、高い正確性を維持できる。
  • 合計クエリ複雑度は、$(k,\varepsilon)$-非還元可能なデータセットでは$O(k^7/\varepsilon^8)$、一般には$O(k^{15}/\varepsilon^8)$であり、両者とも$n$に依存しない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。