[논문 리뷰] Information Theoretic Measures for Fairness-aware Feature Selection
이 논문은 상호정보량 기반의 정보이론적 프레임워크를 제안하여 예측 정확도와 차별성에 대한 각 특징의 경계적 영향을 측정한다. Shapley 값 기반으로 정의된 정확도 및 차별성 계수를 통해 특정 분류기의 종속성을 줄이고, 유틸리티와 공정성의 균형을 이루는 특징 선택을 가능하게 한다. 합성 데이터 및 COMPAS 데이터셋에서 검증되었으며, 연령과 이전 기소 수와 같은 고영향도 특징을 제거함으로써 편향이 유의미하게 감소하는 결과를 보였다.
Machine learning algorithms are increasingly used for consequential decision making regarding individuals based on their relevant features. Features that are relevant for accurate decisions may however lead to either explicit or implicit forms of discrimination against unprivileged groups, such as those of certain race or gender. This happens due to existing biases in the training data, which are often replicated or even exacerbated by the learning algorithm. Identifying and measuring these biases at the data level is a challenging problem due to the interdependence among the features, and the decision outcome. In this work, we develop a framework for fairness-aware feature selection which takes into account the correlation among the features and the decision outcome, and is based on information theoretic measures for the accuracy and discriminatory impacts of features. In particular, we first propose information theoretic measures which quantify the impact of different subsets of features on the accuracy and discrimination of the decision outcomes. We then deduce the marginal impact of each feature using Shapley value function; a solution concept in cooperative game theory used to estimate marginal contributions of players in a coalitional game. Finally, we design a fairness utility score for each feature (for feature selection) which quantifies how this feature influences accurate as well as nondiscriminatory decisions. Our framework depends on the joint statistics of the data rather than a particular classifier design. We examine our proposed framework on real and synthetic data to evaluate its performance.
연구 동기 및 목표
- 기계학습 시스템에서 정확한 예측과 차별적 결과를 유도하는 특징을 식별하는 데 도전 과제를 해결한다.
- 특징 간 상호의존성을 고려하여 정확도 및 차별성에 대한 특징의 경계적 영향을 정량화하는 방법을 개발한다.
- 예측 성능와 공정성 간의 트레이드오프를 고려한 특징 선택을 가능하게 하는 공정성-유틸리티 점수를 만든다.
- 분류기 종속성을 제거하기 위해 특징, 민감 속성 및 결과의 연합 통계 분포에만 의존하는 프레임워크를 확보한다.
- 실제 데이터(COMPAS) 및 합성 데이터셋에서의 평가를 통해 이 프레임워크가 정확도 손실 없이 편향을 감소시키는 데 효과적임을 입증한다.
제안 방법
- 특징 부분집합, 민감 속성 및 결과 간 상호정보량 기반으로 정확도 영향의 경계적 영향(φ^Acc)과 차별성 영향의 경계적 영향(φ^D)을 측정하는 두 가지 정보이론적 측정치를 정의한다.
- 협동 게임 이론의 Shapley 값 기반으로 각 개별 특징의 전체 정확도 및 차별성 점수에 대한 경계 기여도를 계산한다.
- 정확도와 공정성 목표 간 균형을 조절하는 하이퍼파rameter α를 활용해 φ^Acc와 φ^D의 가중 조합으로 공정성-유틸리티 점수를 구성한다.
- 데이터로부터 연합 확률 분포를 계산하거나 합성 사례에서는 그래픽 모델을 사용해 모든 필요한 상호정보량 항목을 유도한다.
- 신경망 분류기 학습을 통해 실제 및 합성 데이터셋에 프레임워크를 적용하고, 특징을 제거했을 때 예측 오차와 편향(KL 발산)의 변화를 측정한다.
- 100회 반복 실험에서의 신뢰구간을 활용해 측정치의 안정성을 평가한다.
실험 결과
연구 질문
- RQ1특징 간 상호의존성을 고려하여 각 특징의 정확도 및 차별성에 대한 경계적 기여도를 어떻게 정량화할 수 있는가?
- RQ2정보이론적 측정치가 특징, 민감 속성 및 의사결정 결과 간 비선형 관계를 얼마나 잘 포착할 수 있는가?
- RQ3Shapley 값 기반 분해가 협동 프레임워크 내에서 공정성 및 유틸리티에 대한 특징의 개별 기여도를 효과적으로 분리할 수 있는가?
- RQ4제안된 공정성-유틸리티 점수는 기존 방법에 비해 실세계 데이터셋에서 고영향도의 차별적 대체변수를 식별하는 데 얼마나 효과적인가?
- RQ5높은 차별성 계수를 가진 특징을 제거하면 정확도 손실 없이 분류기의 편향이 유의미하게 감소하는가?
주요 결과
- 합성 데이터셋에서 X₃와 X₄는 각각 가장 높은 정확도 경계 기여 계수(4.467 및 3.122)를 보였으며, 이들의 제거로 예측 오차가 가장 크게 증가했다.
- 특징 X₁은 가장 높은 차별성 경계 기여 계수(2.7927 × 10⁷)를 보였고, 그 제거로 분류기 출력의 편향이 가장 낮아졌다.
- COMPAS 데이터셋에서 연령과 이전 기소 수는 각각 가장 높은 차별성 계수(6.0904 × 10⁶ 및 5.0466 × 10⁶)를 보였으며, 이들의 제거로 편향 감소 효과가 가장 컸다.
- 기소 정도와 성별은 가장 낮은 정확도 계수(0.1723 및 0.4186)를 보였고, 이들의 제거로 예측 오차에 미치는 영향은 최소였으며, 이는 분류에 대해 낮은 유틸리티를 가짐을 확인한다.
- 프레임워크는 COMPAS 데이터셋에서 연령과 이전 기소 수가 인종에 대한 강력한 대체변수임을 성공적으로 식별했으며, 이는 이전의 레드라인 및 대체 차별성 연구 결과와 일치한다.
- 두 데이터셋의 결과는 제안된 계수와 실제 분류기 성능 및 편향 변화 사이에 강한 상관관계를 보이며, 프레임워크의 신뢰성과 해석 가능성에 대한 검증을 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.