Skip to main content
QUICK REVIEW

[논문 리뷰] Coresets for Clustering with Fairness Constraints

Lingxiao Huang, Shaofeng H.-C. Jiang|arXiv (Cornell University)|2019. 06. 20.
Face and Expression Recognition참고 문헌 31인용 수 21
한 줄 요약

이 논문은 공정한 $k$-중심 군집화를 위한 처음으로 알려진 코어셋 구성법을 제안하며, 다수의 상호 중첩되지 않는 민감한 유형을 가진 공정한 $k$-평균 군집화에 대해 이전의 코어셋 방법을 향상시킨다. 새로운 기하학적 구성 기법을 활용하여, $k$-중심의 경우 $O(\Gamma k^2\varepsilon^{-d})$, $k$-평균의 경우 $O(\Gamma k^3\varepsilon^{-d-1})$ 크기의 $\varepsilon$-코어셋을 달성한다. 여기서 $\Gamma$는 점이 속할 수 있는 고유한 그룹 조합의 수이며, 전체 데이터셋 크기와 무관하므로, 증명 가능하고 확장 가능한 공정한 군집화를 가능하게 한다.

ABSTRACT

In a recent work, [19] studied the following "fair" variants of classical clustering problems such as $k$-means and $k$-median: given a set of $n$ data points in $\mathbb{R}^d$ and a binary type associated to each data point, the goal is to cluster the points while ensuring that the proportion of each type in each cluster is roughly the same as its underlying proportion. Subsequent work has focused on either extending this setting to when each data point has multiple, non-disjoint sensitive types such as race and gender [6], or to address the problem that the clustering algorithms in the above work do not scale well. The main contribution of this paper is an approach to clustering with fairness constraints that involve multiple, non-disjoint types, that is also scalable. Our approach is based on novel constructions of coresets: for the $k$-median objective, we construct an $\varepsilon$-coreset of size $O(Γk^2 \varepsilon^{-d})$ where $Γ$ is the number of distinct collections of groups that a point may belong to, and for the $k$-means objective, we show how to construct an $\varepsilon$-coreset of size $O(Γk^3\varepsilon^{-d-1})$. The former result is the first known coreset construction for the fair clustering problem with the $k$-median objective, and the latter result removes the dependence on the size of the full dataset as in [39] and generalizes it to multiple, non-disjoint types. Plugging our coresets into existing algorithms for fair clustering such as [5] results in the fastest algorithms for several cases. Empirically, we assess our approach over the extbf{Adult}, extbf{Bank}, extbf{Diabetes} and extbf{Athlete} dataset, and show that the coreset sizes are much smaller than the full dataset. We also achieve a speed-up to recent fair clustering algorithms [5,6] by incorporating our coreset construction.

연구 동기 및 목표

  • 대규모 데이터셋에서 성능이 떨어지는 기존의 공정한 군집화 알고리즘의 확장성 한계를 해결하기 위해.
  • 인종과 성별과 같은 다수의 상호 중첩되지 않는 민감한 유형을 가진 환경으로 공정한 군집화를 확장하기 위해.
  • 전체 데이터셋 크기 $n$에 독립적인 코어셋을 공정한 $k$-중심 및 $k$-평균 군집화를 위해 구성하기 위해.
  • 코어셋이 공정성 제약을 유지하면서도 크기는 작고 근사 오차는 낮게 유지되도록 보장하기 위해.
  • 전체 데이터셋을 대체로 사용하는 코어셋을 통해 공정한 군집화 목표의 계산 속도를 향상시키기 위해.

제안 방법

  • 다수의 민감한 유형에 걸쳐 공정성 제약을 고려한 기하학적 샘플링 기법을 통해 $\varepsilon$-코어셋을 구성하기 위해.
  • $\Gamma$를 데이터 포인트가 속할 수 있는 고유한 그룹 조합의 수로 정의하여, 코어셋 크기를 전체 데이터셋 크기 $n$과 무관하게 제한하기 위해.
  • 선형 케이스 분석 기반의 새로운 $k$-중심 코어셋 구성법을 제안하고, 기하학적 분할 기법을 통해 고차원으로 확장하기 위해.
  • 두 번째 순서 모멘트 근사와 그룹별 가중치 부여 기법을 도입하여 비상호 독립적인 유형을 다루는 방식으로 $k$-평균으로 확장하기 위해.
  • 집중도 및 민감도 샘플링 기반 증명을 통해 코어셋의 정확성을 확보하여, 공정한 군집화 목표의 $(1\pm\varepsilon)$-근사치를 보장하기 위해.
  • 실제 구현에서 $\varepsilon^{-d}$ 요소를 피하기 위해 최적화하여, 더 작고 빠른 코어셋 생성을 가능하게 하기 위해.

실험 결과

연구 질문

  • RQ1전체 데이터셋 크기 $n$에 독립적인 크기의 $\varepsilon$-코어셋을 공정한 $k$-중심 군집화에 대해 구성할 수 있는가?
  • RQ2기존의 공정한 $k$-평균 군집화를 위한 코어셋 구성법을 다수의 상호 중첩되지 않는 민감한 유형을 다룰 수 있도록 확장할 수 있는가?
  • RQ3코어셋이 크기와 근사 오차를 최소화하면서도 공정성 제약을 유지할 수 있도록 보장하는 방법은 무엇인가?
  • RQ4코어셋의 경험적 성능은 FairTree 및 FairLP와 같은 공정한 군집화 알고리즘의 가속화에 얼마나 기여하는가?
  • RQ5코어셋 구성법을 여러 공정성 제약이나 군집화 작업에 재사용할 수 있도록 효율적으로 만들 수 있는가?

주요 결과

  • 공정한 $k$-중심 군집화를 위한 코어셋은 이와 같은 형태로 알려진 첫 번째 구성법으로, 크기가 $O(\Gamma k^2\varepsilon^{-d})$임을 달성하였다.
  • 공정한 $k$-평균 군집화의 경우, 코어셋 크기 $O(\Gamma k^3\varepsilon^{-d-1})$는 이전 작업에서 $\log n$에 대한 의존성을 제거하고 다수의 상호 중첩되지 않는 유형으로 일반화함으로써 향상된 결과를 보였다.
  • Adult, Bank, Diabetes, Athlete 데이터셋에서, 코어셋 크기는 전체 데이터셋 크기의 3% 미만이었고, 5% 이내의 경험적 오차를 달성하였다.
  • 코어셋 생성 시간을 포함하여도, 공정한 군집화 목표 평가에서 200배의 속도 향상을 달성하였다.
  • FairTree 및 FairLP와의 통합으로 각각 5x–15x, 15x–30x의 속도 향상을 얻었으며, FairLP는 모든 데이터셋에서 1초 이내로 실행되었다.
  • 코어셋 기반 군집화 목표는 전체 데이터셋 목표의 0.6–1.2배 이내였고, 한 가지 예외(Census1990)를 제외하고는 더 작은 데이터에서 더 나은 근사해를 제공하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.