Skip to main content
QUICK REVIEW

[论文解读] A Notion of Individual Fairness for Clustering

Matthäus Kleindeßner, Pranjal Awasthi|arXiv (Cornell University)|Jun 8, 2020
Ethics and Social Impacts of AI参考文献 32被引用 13
一句话总结

本文提出了一种聚类中的个体公平性新概念,要求每个数据点平均而言比与其他聚类成员的距离更接近其自身聚类的成员。作者证明,一般情况下寻找此类聚类是 NP-难问题,但提出了一个动态规划算法,可高效计算实数轴上数据的个体公平聚类,并在真实数据集上评估启发式算法以最小化公平性违规。

ABSTRACT

A common distinction in fair machine learning, in particular in fair classification, is between group fairness and individual fairness. In the context of clustering, group fairness has been studied extensively in recent years; however, individual fairness for clustering has hardly been explored. In this paper, we propose a natural notion of individual fairness for clustering. Our notion asks that every data point, on average, is closer to the points in its own cluster than to the points in any other cluster. We study several questions related to our proposed notion of individual fairness. On the negative side, we show that deciding whether a given data set allows for such an individually fair clustering in general is NP-hard. On the positive side, for the special case of a data set lying on the real line, we propose an efficient dynamic programming approach to find an individually fair clustering. For general data sets, we investigate heuristics aimed at minimizing the number of individual fairness violations and compare them to standard clustering approaches on real data sets.

研究动机与目标

  • 为解决聚类中缺乏个体公平性概念的问题,尽管已有大量关于群体公平性的工作。
  • 定义一个有意义的公平性准则,确保每个数据点都能被其聚类良好代表。
  • 研究在各种设置下个体公平聚类的存在性与计算方法。
  • 评估启发式方法以最小化高维数据中的个体公平性违规。

提出的方法

  • 提出一种公平性概念,要求每个数据点到其自身聚类的平均距离低于到任何其他聚类的平均距离。
  • 设计一种动态规划算法,用于计算实数轴上数据的个体公平聚类。
  • 证明判断是否存在个体公平 k-聚类的问题是 NP-难的,即使在 k=2 且使用欧几里得度量时也是如此。
  • 开发启发式算法,通过迭代分裂聚类来最小化公平性违规数量或最大违规程度。
  • 采用标准聚类算法(k-means、层次聚类)作为基线,并使用公平性度量进行比较。
  • 使用真实世界数据集(Adult、Drug Consumption、Indian Liver Patient)和多种距离度量评估性能。

实验结果

研究问题

  • RQ1对于给定的数据集和聚类数量,个体公平聚类是否总是存在?
  • RQ2能否为实数轴上的数据高效计算个体公平聚类?
  • RQ3判断是否存在个体公平 k-聚类的问题在一般情况下是否为 NP-难?
  • RQ4标准聚类算法在真实世界数据集上的个体公平性违规表现如何?
  • RQ5启发式方法能否改进标准聚类算法,以减少个体公平性违规?

主要发现

  • 对于实数轴上的数据,个体公平聚类总是存在,并且可以使用动态规划高效计算。
  • 判断是否存在个体公平 k-聚类的问题即使在 k=2 且使用欧几里得距离时也是 NP-难的。
  • 在 R² 中,个体公平聚类可能不存在,这表明该公平性概念存在根本性局限。
  • 旨在最小化违规数量或最大违规程度的启发式方法在真实数据集上优于标准聚类算法。
  • 在 Adult 数据集上,所提出的 1D 算法在非欧几里得度量下显著减少了公平性违规,优于 k-means。
  • 标准聚类算法在不同度量下的表现各异,平均 linkage 和完全 linkage 在公平性行为上比单 linkage 更具一致性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。