[논문 리뷰] Two-stage Algorithm for Fairness-aware Machine Learning
이 논문은 감정 변수와 예측값 간의 상관관계를 분리하기 위해 유사한 통제변수 전처리 기법을 사용하는 두 단계 알고리즘(2SDR)을 제안한다. 이는 분류 및 회귀 작업에서 불공정 영향을 완화하며, 인공 및 실세계 데이터셋에서 80%-규칙을 충족하면서도 수치형 감정 변수와 설명 변수를 지원하여 기존 방법들에 비해 유연성과 공정성 준수 면에서 뛰어나다.
Algorithmic decision making process now affects many aspects of our lives. Standard tools for machine learning, such as classification and regression, are subject to the bias in data, and thus direct application of such off-the-shelf tools could lead to a specific group being unfairly discriminated. Removing sensitive attributes of data does not solve this problem because a extit{disparate impact} can arise when non-sensitive attributes and sensitive attributes are correlated. Here, we study a fair machine learning algorithm that avoids such a disparate impact when making a decision. Inspired by the two-stage least squares method that is widely used in the field of economics, we propose a two-stage algorithm that removes bias in the training data. The proposed algorithm is conceptually simple. Unlike most of existing fair algorithms that are designed for classification tasks, the proposed method is able to (i) deal with regression tasks, (ii) combine explanatory attributes to remove reverse discrimination, and (iii) deal with numerical sensitive attributes. The performance and fairness of the proposed algorithm are evaluated in simulations with synthetic and real-world datasets.
연구 동기 및 목표
- 감정 변수가 비감정 특성과 상관관계가 있을 때 알고리즘 의사결정에서의 불공정 영향을 해결하기 위해.
- 대부분의 기존 방법이 분류 작업에만 집중하는 것과는 달리, 분류 및 회귀 작업 모두에 적용 가능한 공정한 기계학습 방법을 개발하기 위해.
- 실세계 응용에서 흔한 연속형(수치형) 감정 변수(예: 연령)를 처리할 수 있도록 하기 위해.
- 예를 들어 근무 시간과 같은 설명 변수를 포함시켜 역방향 차별을 방지하면서도 공정성을 유지하기 위해.
- 데이터 전처리와 종단 간 공정 학습 사이의 균형을 이루는 방법을 설계하여 변환을 최소화하면서도 공정성을 보장하기 위해.
제안 방법
- 알고리즘은 경제학에서 두 단계 최소제곱법(2SLS)에 영감을 얻은 두 단계 접근법을 사용한다.
- 첫 번째 단계에서는 목표 변수를 감정 변수에 대해 회귀분석하여 감정 변수와 상관관계가 없는 잔차를 추출한다.
- 두 번째 단계에서는 첫 번째 단계에서 구한 잔차를 바탕으로 설명 변수를 사용해 결과를 예측하는 선형 모델(예: 리지 회귀 또는 로지스틱 회귀)을 훈련한다.
- 이 방법은 최종 예측값이 감정 변수와 상관관계가 없음을 보장한다(정리 1 및 2), 따라서 불공정 영향을 감소시킨다.
- 수치형 감정 변수를 지원하며, 두 번째 단계에서 일반화된 선형 모델을 활용할 수 있다.
- 비이진형 속성에 대해 순서형 변환(분위수 기반)을 적용하여 감정 변수와의 상관관계를 감소시키지만, 이는 약간의 정확도 저하를 초래한다.
실험 결과
연구 질문
- RQ1두 단계 알고리즘이 분류 및 회귀 작업 모두에서 불공정 영향을 효과적으로 감소시킬 수 있는가?
- RQ2감정 변수가 수치형(예: 연령)일 경우, 이 방법은 어떻게 성능을 보이는가?
- RQ3설명 변수의 포함이 역방향 차별을 방지하면서도 공정성을 유지하는 데 기여하는가?
- RQ4두 단계 설계가 기존의 전처리 및 후처리 공정성 방법에 비해 공정성과 정확도 측면에서 뛰어나게 되는가?
- RQ5두 번째 단계에서 비선형 모델을 사용할 경우 공정성과 성능에 어떤 영향을 미치는가?
주요 결과
- 2SDR 알고리즘은 다양한 평가 지표에서 Adult 및 C&C 데이터셋에서 80%-규칙을 준수하였다.
- Adult 데이터셋에서 2SDR는 순서형 변환 없이도 분류 작업에서 p%-규칙 0.83을 달성하여 80% 기준을 초과하였다.
- C&C 데이터셋에서의 회귀 작업에서는 2SDR이 평균 편차(MD)를 0.02로 감소시키고, RMSE를 0.18로 낮춰 강력한 공정성과 성능를 보였다.
- 두 번째 단계에서 로지스틱 회귀를 사용할 경우 Adult 데이터셋에서 p%-규칙이 0.72로 떨어졌으며, 이는 비선형 모델이 재차 편향을 유도할 수 있음을 시사한다.
- 순서형 변환은 정확도를 약간 감소시켰다(예: 2SDR에서 0.82 대비 0.83), 그러나 감정 변수와의 상관관계 감소로 인해 공정성 향상에 기여하였다.
- 비선형 두 번째 단계 모델(예: SVM, GBM)은 선형 모델에 비해 훨씬 열악한 공정성을 보였으며, 이는 예측값의 비상관관계를 유지하기 위해 선형성의 중요성을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.