Skip to main content
QUICK REVIEW

[論文レビュー] (Individual) Fairness for k-Clustering

Sepideh Mahabadi, Ali Vakilian|arXiv (Cornell University)|Jul 12, 2020
Facility Location and Emergency Management被引用数 15
ひとこと要約

この論文は、公平な $k$-メディアンおよび $k$-ミーンズクラスタリングのためのローカルサーチアルゴリズムを提示する。このアルゴリズムはバイクリテリア近似を達成する:クラスタリングコストは最適な公平クラスタリングの定数倍の範囲内にあり、公平性条件—各点 $x$ が半径 $r(x)$ 内にセンターを有すること—は近似的に満たされる。この手法は、半径に基づく公平性のしきい値を用いて、クラスタサイズとコストのバランスを保つことで、個人の公平性を確保する。

ABSTRACT

We give a local search based algorithm for $k$-median and $k$-means (and more generally for any $k$-clustering with $\ell_p$ norm cost function) from the perspective of individual fairness. More precisely, for a point $x$ in a point set $P$ of size $n$, let $r(x)$ be the minimum radius such that the ball of radius $r(x)$ centered at $x$ has at least $n/k$ points from $P$. Intuitively, if a set of $k$ random points are chosen from $P$ as centers, every point $x\in P$ expects to have a center within radius $r(x)$. An individually fair clustering provides such a guarantee for every point $x\in P$. This notion of fairness was introduced in [Jung et al., 2019] where they showed how to get an approximately feasible $k$-clustering with respect to this fairness condition. In this work, we show how to get a bicriteria approximation for fair $k$-clustering: The $k$-median ($k$-means) cost of our solution is within a constant factor of the cost of an optimal fair $k$-clustering, and our solution approximately satisfies the fairness condition (also within a constant factor). Further, we complement our theoretical bounds with empirical evaluation.

研究の動機と目的

  • 各点 $x$ が $n/k$ 個の点を含む最小の半径 $r(x)$ の範囲内にセンターを持つことを保証することで、$k$-クラスタリングにおける個人の公平性を扱う。
  • 最適な公平な $k$-メディアンおよび $k$-ミーンズクラスタリングを近似しつつ、公平性の保証を維持する実用的なアルゴリズムを開発すること。
  • 理論的バイクリテリア近似バウンドを提供すること:クラスタリングコストは定数倍の近似であり、公平性の違反も定数倍以内である。
  • 実世界の設定において、公平性とクラスタリングコストのトレードオフを経験的に検証すること。

提案手法

  • 点 $x$ の周囲で少なくとも $n/k$ 個の点を含む最小の半径 $r(x)$ を、データセット $P$ に対して定義する。
  • ローカルサーチ手順を用いて、$\ell_p$ コストを低下させながら、センターの入れ替えを繰り返し行い、$k$-クラスタリング解を段階的に改善する。この際、公平性の違反も追跡する。
  • 各点 $x$ が解内のあるセンターから定数倍の $r(x)$ の範囲内にあることを保証することで、公平性を維持する。
  • バイクリテリア解析を適用する:解のコストは最適な公平クラスタリングコストの定数倍以内であり、公平性の違反も定数倍以内である。
  • 半径 $r(x)$ の構造を活用して、1クラスタあたりの点数を制限し、クラスタサイズのバランスを保証する。

実験結果

リサーチクエスチョン

  • RQ1ローカルサーチアルゴリズムは、コストにおいて定数倍の近似を達成すると同時に、$k$-クラスタリングにおける個人の公平性を近似的に満たすことができるか?
  • RQ2個人の公平性制約下で、公平性半径 $r(x)$ は最適クラスタリングコストとどのように関係するか?
  • RQ3実際の $k$-メディアンおよび $k$-ミーンズにおいて、クラスタリングコストと公平性違反のトレードオフはどのようなものか?
  • RQ4一般の $\ell_p$ ノルムコスト関数に対して、公平 $k$-クラスタリングでバイクリテリア近似を達成できるか?

主な発見

  • 提案されたアルゴリズムはバイクリテリア近似を達成する:$k$-メディアンおよび $k$-ミーンズコストは、最適な公平クラスタリングコストの定数倍の範囲内にある。
  • 公平性条件は近似的に満たされ、各点 $x$ が $r(x)$ の定数倍の範囲内にセンターを持つ。
  • アルゴリズムは、$n$ や $k$ に依存しない定数倍の近似比を、コストおよび公平性の両方で維持する。
  • 経験的評価により、実データセット上でも公平性とクラスタリングコストの良好なトレードオフが達成されていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。