Skip to main content
QUICK REVIEW

[論文レビュー] Distributional Individual Fairness in Clustering

Nihesh Anderson, Suman K. Bera|arXiv (Cornell University)|Jun 22, 2020
Ethics and Social Impacts of AI参考文献 45被引用数 10
ひとこと要約

本稿は、クラスタリングにおける分布的個人的公平性を導入し、類似した個体が類似した方法で扱われるよう保証するフレームワークを提案する。f-発散度を統計的類似度の測度として用いることで、ℓp-ノルムクラスタリング目的関数に対して、証明可能な近似保証を提供するとともに、個人的公平性制約を満たす。実験的に、クラスタリング品質を損なわずに従来手法を上回る公平性を達成していることが示された。

ABSTRACT

In this paper, we initiate the study of fair clustering that ensures distributional similarity among similar individuals. In response to improving fairness in machine learning, recent papers have investigated fairness in clustering algorithms and have focused on the paradigm of statistical parity/group fairness. These efforts attempt to minimize bias against some protected groups in the population. However, to the best of our knowledge, the alternative viewpoint of individual fairness, introduced by Dwork et al. (ITCS 2012) in the context of classification, has not been considered for clustering so far. Similar to Dwork et al., we adopt the individual fairness notion which mandates that similar individuals should be treated similarly for clustering problems. We use the notion of $f$-divergence as a measure of statistical similarity that significantly generalizes the ones used by Dwork et al. We introduce a framework for assigning individuals, embedded in a metric space, to probability distributions over a bounded number of cluster centers. The objective is to ensure (a) low cost of clustering in expectation and (b) individuals that are close to each other in a given fairness space are mapped to statistically similar distributions. We provide an algorithm for clustering with $p$-norm objective ($k$-center, $k$-means are special cases) and individual fairness constraints with provable approximation guarantee. We extend this framework to include both group fairness and individual fairness inside the protected groups. Finally, we observe conditions under which individual fairness implies group fairness. We present extensive experimental evidence that justifies the effectiveness of our approach.

研究の動機と目的

  • クラスタリングにおける個人的公平性の欠如、特にグループ公平性では依然として類似した個体に損害を及える可能性があるという問題に対処すること。
  • 類似点が統計的に類似したクラスタリングアサインメントを受けるように、分布的アサインメントモデルを用いてクラスタリングにおける個人的公平性を形式化すること。
  • 個人的公平性とグループ公平性の両方を統合するフレームワークを提供し、個人的公平性がグループ公平性を意味する条件を示すこと。
  • 個人的公平性制約下でℓp-ノルムクラスタリング目的関数に対して証明可能な近似保証を持つアルゴリズムを設計すること。
  • 提案手法が低コストのクラスタリングを維持しながら強い個人的公平性を達成することを実験的に検証すること。従来の確率的クラスタリング手法を上回る。

提案手法

  • 各点をk個のクラスタ中心に対する確率分布としてモデル化し、公平性類似度測度𝒮に基づく類似点が統計的に類似した分布を受けるように保証する。
  • f-発散度を分布間の統計的距離測度として用い、公平性を定量化する。これにより、従来の全変動やℓ∞-ベースのメトリクスを一般化する。
  • 線形計画法を用いて期待クラスタリングコストを最小化するが、任意の2点の分布間のf-発散度がそれらの公平性類似度測度によって上限付けられるように制約を課す。
  • 保護群内のグループ公平性を組み込むことで、バランスの取れた代表性を確保しながら個人的公平性を維持する。
  • k-means、k-center、および他のℓp-ノルムクラスタリング問題に本アプローチを適用し、近似比に関する理論的保証を提示する。
  • 実験では、本手法をソフトk-meansおよび他のベースラインと比較し、さまざまなパラメータ下での公平性違反とクラスタリングコストを測定する。

実験結果

リサーチクエスチョン

  • RQ1個人的公平性、すなわち類似した個体が類似した方法で扱われるという定義を、クラスタリング問題に意味的に拡張できるか?
  • RQ2f-発散度を、クラスタリングアサインメント分布間の統計的類似度を一般かつ柔軟に測るための手段として用いることで、個人的公平性をどのように強制できるか?
  • RQ3クラスタリングコストと個人的公平性のトレードオフは何か?そして、証明可能な保証のもとで最適化可能か?
  • RQ4どのような条件下で、クラスタリングにおける個人的公平性がグループ公平性を意味するか?
  • RQ5提案手法は、従来の確率的クラスタリング手法と比較して、公平性とクラスタリング品質の両面で優れているか?

主な発見

  • 提案されたアルゴリズムALG-IFは、いかなる個人的公平性制約も違反しないが、同じクラスタリングコスト下でソフトk-means(SKM)は最大99%の制約を違反する。
  • k=8の場合、ALG-IFと同等のクラスタリングコストを達成する際、SKMは𝒮₁を用いて85%の個人的公平性制約を違反し、顕著な不平等を示している。
  • 本手法は、最適な公平クラスタリング解の定数倍のクラスタリングコストに収束し、ℓp-ノルム目的関数に対して理論的近似保証を達成している。
  • グループ代表の統計的バイアスは、グループ分布と母集団分布間の地球移動距離によって上界が与えられ、実験的ギャップがきわめてタイトである。
  • 約1000万変数・制約の線形計画問題をCPLEXで解くのに9時間未満で完了し、実用的実行可能性が示された。
  • 本フレームワークは、個人的公平性とグループ公平性の両方を効果的に統合しており、𝒮₁類似度測度下では個人的公平性がグループ公平性を意味する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。