Skip to main content
QUICK REVIEW

[논문 리뷰] A Notion of Individual Fairness for Clustering

Matthäus Kleindeßner, Pranjal Awasthi|arXiv (Cornell University)|2020. 06. 08.
Ethics and Social Impacts of AI참고 문헌 32인용 수 13
한 줄 요약

이 논문은 클러스터링을 위한 새로운 개인적 공정성 개념을 제안하며, 각 데이터 포인트가 자신의 클러스터 구성원들보다 다른 클러스터의 구성원들보다 평균적으로 더 가까워야 한다는 조건을 포함한다. 저자들은 일반적으로 이러한 클러스터링을 찾는 것이 NP-난해하다는 것을 증명하지만, 실수선 상의 데이터에 대해 효율적으로 개인적 공정 클러스터링을 계산할 수 있는 동적 프rogram밍 알고리즘을 제시하고, 실제 데이터셋에서 휴리스틱 기법을 평가하여 공정성 위반을 최소화한다.

ABSTRACT

A common distinction in fair machine learning, in particular in fair classification, is between group fairness and individual fairness. In the context of clustering, group fairness has been studied extensively in recent years; however, individual fairness for clustering has hardly been explored. In this paper, we propose a natural notion of individual fairness for clustering. Our notion asks that every data point, on average, is closer to the points in its own cluster than to the points in any other cluster. We study several questions related to our proposed notion of individual fairness. On the negative side, we show that deciding whether a given data set allows for such an individually fair clustering in general is NP-hard. On the positive side, for the special case of a data set lying on the real line, we propose an efficient dynamic programming approach to find an individually fair clustering. For general data sets, we investigate heuristics aimed at minimizing the number of individual fairness violations and compare them to standard clustering approaches on real data sets.

연구 동기 및 목표

  • 클러스터링 분야에서 그룹 공정성에 대한 광범위한 연구가 이루어졌음에도 불구하고 개인적 공정성 개념의 부재를 해결하기 위해.
  • 각 데이터 포인트가 자신의 클러스터에 잘 대표됨을 보장하는 의미 있는 공정성 기준을 정의하기 위해.
  • 다양한 환경에서 개인적 공정 클러스터링의 존재성과 계산 가능성에 대해 조사하기 위해.
  • 고차원 데이터에서 개인적 공정성 위반을 최소화하기 위한 휴리스틱 접근법 평가하기 위해.

제안 방법

  • 각 데이터 포인트가 자신의 클러스터보다 다른 클러스터의 모든 포인트보다 평균 거리가 작아야 하는 공정성 기준을 제안한다.
  • 실수선 상의 데이터에 대해 개인적 공정 클러스터링을 계산하는 데 사용할 수 있는 동적 프로그래밍 알고리즘을 설계한다.
  • 개인적 공정 k-클러스터링의 존재 여부를 판단하는 것이 일반적으로 NP-난해하다는 것을 증명한다. 특히 k=2 및 유클리드 거리의 경우에도 마찬가지다.
  • 공정성 위반 수 또는 최대 위반도를 최소화하기 위해 반복적으로 클러스터를 분할하는 휴리스틱 알고리즘을 개발한다.
  • 기준으로 표준 클러스터링 알고리즘(k-means, 연결 기반)을 사용하고, 공정성 지표를 통해 성능을 비교한다.
  • 실제 데이터셋(Adult, Drug Consumption, Indian Liver Patient)을 사용하여 다양한 거리 측정법을 적용해 성능을 평가한다.

실험 결과

연구 질문

  • RQ1주어진 데이터셋과 클러스터 수에 대해 항상 개인적 공정 클러스터링이 존재하는가?
  • RQ2실수선 상의 데이터에 대해 개인적 공정 클러스터링을 효율적으로 계산할 수 있는가?
  • RQ3일반적으로 개인적 공정 k-클러스터링의 존재 여부를 판단하는 문제가 NP-난해한가?
  • RQ4실제 데이터셋에서 표준 클러스터링 알고리즘이 개인적 공정성 위반 측면에서 어떻게 성능을 내는가?
  • RQ5휴리스틱 접근법이 표준 클러스터링 알고리즘을 개선하여 개인적 공정성 위반을 줄일 수 있는가?

주요 결과

  • 실수선 상의 데이터에 대해서는 항상 개인적 공정 클러스터링이 존재하며, 동적 프로그래밍을 통해 효율적으로 계산 가능하다.
  • 개인적 공정 k-클러스터링의 존재 여부를 판단하는 문제는 일반적으로 NP-난해하며, k=2 및 유클리드 거리의 경우에도 마찬가지다.
  • R² 상의 데이터에서는 개인적 공정 클러스터링이 존재하지 않을 수 있어, 이 공정성 개념의 근본적인 한계를 보여준다.
  • 공정성 위반 수 또는 최대 위반도를 최소화하는 데 초점을 맞춘 휴리스틱 접근법이 실제 데이터셋에서 표준 클러스터링 알고리즘보다 뛰어난 성능을 보인다.
  • Adult 데이터셋에서 제안된 1차원 알고리즘이 k-means보다 훨씬 적은 공정성 위반을 기록했으며, 비유클리드 거리 측정법을 사용할 경우 더욱 두드러진다.
  • 표준 클러스터링 알고리즘의 성능은 거리 측정법에 따라 다양하게 나타나며, 평균 연결법과 완전 연결법은 단일 연결법보다 더 일관된 공정성 행동을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.