[论文解读] Approximate Group Fairness for Clustering
本文提出了核心公平性(core fairness)作为中心聚类的一种改进的群体公平性概念,其中任何至少包含 $ n/k $ 名代理人的联盟都无法通过迁移到新中心来集体减少其总距离。作者通过两个松弛方式——对阻断联盟的规模和距离改善程度的松弛——提出了近似核心公平性,并设计了在直线、树结构和一般度量空间中实现强公平性且效率损失有界的近似算法。
We incorporate group fairness into the algorithmic centroid clustering problem, where $k$ centers are to be located to serve $n$ agents distributed in a metric space. We refine the notion of proportional fairness proposed in [Chen et al., ICML 2019] as {\em core fairness}, and $k$-clustering is in the core if no coalition containing at least $n/k$ agents can strictly decrease their total distance by deviating to a new center together. Our solution concept is motivated by the situation where agents are able to coordinate and utilities are transferable. A string of existence, hardness and approximability results is provided. Particularly, we propose two dimensions to relax core requirements: one is on the degree of distance improvement, and the other is on the size of deviating coalition. For both relaxations and their combination, we study the extent to which relaxed core fairness can be satisfied in metric spaces including line, tree and general metric space, and design approximation algorithms accordingly.
研究动机与目标
- 通过形式化一种强于比例公平性的更强公平性概念,解决中心聚类中的群体公平性问题。
- 研究在度量空间(包括直线、树结构和一般度量)中核心聚类的存在性与可近似性。
- 通过两个维度对核心公平性条件进行松弛:最小距离改善程度与最小联盟规模,从而实现可实用的近似算法。
- 设计在现实聚类场景中平衡公平性(核心稳定性)与效率(低社会成本)的算法。
- 通过实证验证,所提出的算法在公平性度量上优于标准聚类方法(如 k-means++ 和 Lloyd 算法),同时保持了具有竞争力的效率。
提出的方法
- 将核心公平性定义为一种稳定性条件:任何规模至少为 $ n/k $ 的联盟都无法通过迁移到新中心来严格减少其总距离。
- 引入两种松弛方式:$ (eta, eta) $-core(联盟规模阈值)与 $ (eta, eta) $-core(距离改善阈值),对核心概念进行推广。
- 为直线、树结构和一般度量空间中的 $ (eta, eta) $-core 设计近似算法,并提供公平性与社会成本方面的性能保证。
- 提出一种两阶段算法 $ ALG_g^+ $,首先识别公平的候选中心,然后通过最小化总距离将代理分配至中心。
- 采用贪心选择策略,迭代提升公平性,同时将社会成本相对于最优 k-means/k-medians 的比值控制在合理范围内。
- 在合成数据集(高斯分布、S-sets)和真实数据集(Mopsi 位置)上进行广泛实验,评估公平性($ \alpha, \beta $)与效率(社会成本比)。
实验结果
研究问题
- RQ1在直线、树结构和一般度量空间等度量空间中,能否保证核心公平性?其存在性与可近似性有何限制?
- RQ2如何有意义地松弛核心公平性条件,以支持实用的近似算法,同时保持公平性保证?
- RQ3在聚类算法中,公平性(以 $ \alpha $ 和 $ \beta $ 衡量)与效率(社会成本)之间的权衡关系如何?
- RQ4在真实与合成数据上,所提出的算法与 k-means++ 和 Lloyd 算法相比,在公平性与效率方面表现如何?
- RQ5在何种场景下,所提出的算法能实现精确的核心公平性($ \alpha = 1, \beta = 1 $),而在何种情况下需要使用松弛?
主要发现
- 在高斯分布与 S-sets 数据集上,所提出的 $ ALG_g^+ $ 算法的 $ \alpha $ 和 $ \beta $ 值显著低于 k-means++,表明其具有更强的近似核心公平性。
- 在 $ k=10 $ 的 Mopsi 位置数据集上,算法 4 与 Lloyd 算法均实现了 $ \alpha = 1, \beta = 1 $,表明达到精确核心公平性,尽管社会成本比为 1.38。
- 在 $ k $-medians 目标下,算法 4 在高斯数据集上优于 Lloyd 算法,无论在公平性($ \alpha $ 与 $ \beta $)还是社会成本方面。
- 在 $ k $-means 目标下的 S1 数据集上,所提算法在所有 $ k $ 值下均保持优于 k-means++ 的公平性,社会成本比为 1.42。
- 在高斯数据集上,该算法的社会成本比相对于 k-means++ 被限制在一个较小常数范围内,且在某些情况下表现更优。
- 总体而言,所提算法在公平性方面优于标准聚类方法,同时保持了具有竞争力的效率,尤其在高重叠与真实世界场景中表现更佳。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。