Skip to main content
QUICK REVIEW

[論文レビュー] A Notion of Individual Fairness for Clustering

Matthäus Kleindeßner, Pranjal Awasthi|arXiv (Cornell University)|Jun 8, 2020
Ethics and Social Impacts of AI参考文献 32被引用数 13
ひとこと要約

この論文は、クラスタリングにおける個人の公平性の新しい概念を導入し、各データポイントが、自身のクラスタ内のメンバーに対して他のクラスタ内のメンバーよりも平均的に近いことを要件としている。著者らは、一般にそのようなクラスタリングを見つけることがNP困難であることを証明しているが、実数直線上のデータに対しては動的計画法を用いて効率的に個別に公平なクラスタリングを計算するアルゴリズムを提示し、実世界のデータセットを用いて公平性違反を最小化するためのヒューリスティクスを評価している。

ABSTRACT

A common distinction in fair machine learning, in particular in fair classification, is between group fairness and individual fairness. In the context of clustering, group fairness has been studied extensively in recent years; however, individual fairness for clustering has hardly been explored. In this paper, we propose a natural notion of individual fairness for clustering. Our notion asks that every data point, on average, is closer to the points in its own cluster than to the points in any other cluster. We study several questions related to our proposed notion of individual fairness. On the negative side, we show that deciding whether a given data set allows for such an individually fair clustering in general is NP-hard. On the positive side, for the special case of a data set lying on the real line, we propose an efficient dynamic programming approach to find an individually fair clustering. For general data sets, we investigate heuristics aimed at minimizing the number of individual fairness violations and compare them to standard clustering approaches on real data sets.

研究の動機と目的

  • クラスタリングにおけるグループの公平性に関する広範な研究とは対照的に、個人の公平性の概念が欠如している問題に対処すること。
  • 各データポイントがそのクラスタによって適切に代表されることを保証する意味のある公平性基準を定義すること。
  • さまざまな設定における個別に公平なクラスタリングの存在と計算可能性を調査すること。
  • 高次元データにおける個人の公平性違反を最小化するためのヒューリスティックアプローチを評価すること。

提案手法

  • 各データポイントが、自身のクラスタ内のメンバーに対して他の任意のクラスタ内のメンバーよりも平均距離が小さいことを要件とする公平性の概念を提唱する。
  • 実数直線上のデータに対して個別に公平なクラスタリングを計算するための動的計画法アルゴリズムを設計する。
  • 個別に公平なk-クラスタリングの存在を決定することは、k=2およびユークリッド距離に対してもNP困難であることを証明する。
  • 公平性違反の数や最大違反を最小化するために繰り返しクラスタを分割するヒューリスティックアルゴリズムを開発する。
  • 標準的なクラスタリングアルゴリズム(k-means、リンクレージュベース)をベースラインとして用い、公平性指標を用いてそれらと比較する。
  • 実世界のデータセット(Adult、Drug Consumption、Indian Liver Patient)を複数の距離尺度を用いて評価し、性能を検証する。

実験結果

リサーチクエスチョン

  • RQ1与えられたデータセットとクラスタ数に対して、個別に公平なクラスタリングは常に存在するか?
  • RQ2実数直線上のデータに対して、個別に公平なクラスタリングは効率的に計算可能か?
  • RQ3一般に、個別に公平なk-クラスタリングの存在を決定する問題はNP困難か?
  • RQ4実世界のデータセットにおいて、標準的なクラスタリングアルゴリズムは個人の公平性違反に関してどの程度の性能を示すか?
  • RQ5ヒューリスティックアプローチは、標準的なクラスタリングアルゴリズムを改善し、個人の公平性違反を低減できるか?

主な発見

  • 実数直線上のデータに対しては、個別に公平なクラスタリングが常に存在し、動的計画法を用いて効率的に計算可能である。
  • 個別に公平なk-クラスタリングの存在を決定する問題は、k=2およびユークリッド距離に対してもNP困難である。
  • R²上では、個別に公平なクラスタリングが存在しない場合があることから、この公平性概念の根本的な制限が示された。
  • 公平性違反の数や最大違反を最小化するヒューリスティックアプローチは、実データセットにおいて標準的なクラスタリングアルゴリズムを上回る性能を示した。
  • Adultデータセットでは、提案された1次元アルゴリズムがk-meansよりもはるかに少ない公平性違反を達成しており、特にユークリッド距離でない距離尺度下で顕著であった。
  • 標準的なクラスタリングアルゴリズムの性能は距離尺度によって異なるが、平均リンクレージュと完全リンクレージュは、単一リンクレージュよりも一貫した公平性行動を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。