[논문 리뷰] Bias In, Bias Out? Evaluating the Folk Wisdom
이 논문은 선택적 레이블링과 관측되지 않는 변수가 존재하는 설정에서, '편향이 들어가면 편향이 나온다'는 통념을 도전하며, 알고리즘 의사결정 규칙이 편향을 반전시킬 수 있음을 보여준다. 즉, 개인을 정지하는 데 있어 인종적으로 더 편향된 경찰관일수록 결과적으로 편향된 집단에 대해 더 유리한 알고리즘이 만들어진다. 이 편향 반전 현상은 극단적인 편향이 훈련 데이터에서 그 집단의 과도한 표본 추출을 유도함으로써 예측의 선택적 편향을 줄이기 때문에 발생한다.
We evaluate the folk wisdom that algorithmic decision rules trained on data produced by biased human decision-makers necessarily reflect this bias. We consider a setting where training labels are only generated if a biased decision-maker takes a particular action, and so "biased" training data arise due to discriminatory selection into the training data. In our baseline model, the more biased the decision-maker is against a group, the more the algorithmic decision rule favors that group. We refer to this phenomenon as "bias reversal." We then clarify the conditions that give rise to bias reversal. Whether a prediction algorithm reverses or inherits bias depends critically on how the decision-maker affects the training data as well as the label used in training. We illustrate our main theoretical results in a simulation study applied to the New York City Stop, Question and Frisk dataset.
연구 동기 및 목표
- 알고리즘 의사결정 규칙이 인간 의사결정자로부터 편향을 반드시 유산하는지 평가하는 것.
- 편향된 훈련 데이터가 편향 반전을 유도하는 조건을 규명하는 것.
- 인간의 편향이 표본 선택에 영향을 주는 방식과 레이블 측정에 영향을 주는 방식의 차이가 알고리즘의 공정성에 어떤 영향을 미치는지 명확히 하는 것.
- 특정 조건에서 집단 구성원 정보(예: 인종)를 알고리즘이 사용하도록 允허함으로써, 차별을 증가시키지 않고 오히려 감소시킬 수 있음을 보여주는 것.
제안 방법
- 저자들은 세 가지 핵심 구성요소를 가진 이론적 모델을 개발했다: 선택적 레이블링(결정자가 행동할 경우에만 레이블이 관측됨), 취향 기반 편향(결정자가 특정 집단을 선호하거나 기피함), 관측되지 않는 변수(레이블을 예측하는 데 유용하지만 훈련 데이터에 포함되지 않는 특징).
- 인간의 편향이 증가할수록 열등한 집단에 대해 알고리즘이 유리한 태도를 취하는 조건을 도출하였으며, 이를 '편향 반전'이라 명명한다.
- 뉴욕시 정지·질문·검색(SQF) 데이터셋을 사용하여, 흑인과 백인에 대해 검색 기준을 다르게 조절함으로써 다양한 수준의 인종적 편향을 유도하는 시뮬레이션을 통해 합성 훈련 데이터를 생성하였다.
- 합성적으로 선택된 데이터를 바탕으로 로지스틱 회귀를 사용해 압수물 존재 여부를 예측하는 함수를 추정하였으며, 선택 과정에서의 인종적 편향 수준을 다양하게 조절하였다.
- 다양한 편향 수준에서 예측 결과를 비교하여, 편향이 증가함에 따라 위험도가 높은 그룹에 속한 흑인 비율이 어떻게 변화하는지 측정하였다.
- 이론적 결과를 검증하기 위해, 압수물 존재 여부와 합성 검색 플래그에 대한 예측 함수가 증가하는 편향에 어떻게 반응하는지 분석하였다.
실험 결과
연구 질문
- RQ1편향된 인간의 선택이 훈련 데이터에 영향을 주는 조건에서, 알고리즘이 열등한 집단에 대해 유리한 태도를 취하는 조건은 무엇인가?
- RQ2훈련 데이터에 포함되지 않은, 선택에 영향을 주는 관측되지 않는 변수가 존재할 경우, 알고리즘의 공정성에 어떤 영향을 미치는가?
- RQ3인간 의사결정자의 편향이 표본 선택에 영향을 주는 경우, 알고리즘의 예측 결과는 어떻게 변하는가?
- RQ4알고리즘이 집단 구성원 정보(예: 인종)를 사용하도록 허용할 경우, 예측 과제에서 차별을 증가시키지 않고 오히려 감소시킬 수 있는가?
- RQ5레이블 선택 방식(예: 관심 있는 결과 vs. 인간의 결정)이 인간의 편향과 알고리즘의 편향 간 관계에 어떤 영향을 미치는가?
주요 결과
- 흑인에 대한 경찰의 편향이 증가함에 따라(흑인에 대한 검색 기준이 높아짐), 알고리즘이 흑인을 고위험군으로 예측하는 비율이 감소함을 확인하여, 편향 반전 현상을 입증함.
- 경찰이 극단적으로 편향되어 모든 흑인을 위험도와 관계없이 검색할 경우, 알고리즘은 훈련 데이터에서 흑인이 압수물을 소지할 가능성이 낮다는 것을 학습하여, 더 유리한 예측을 내림.
- 압수물 존재 확률을 추정하는 예측 함수의 경우, 편향이 증가할수록 흑인에 대한 위험도 점수가 낮아지며, 이는 '편향이 들어가면 유리함이 나온다'는 현상을 확인함.
- 반대로, 합성 검색 결정 자체를 모델링하는 예측 함수의 경우, 편향이 증가할수록 흑인에 대한 예측 검색 가능성은 높아지며, 이는 전통적인 '편향이 들어가면 편향이 나온다'는 직관과 일치함.
- 시뮬레이션 결과, 흑인에 대한 검색 비율이 95%로 증가(백인 대비 80%)할 경우, 위험도 상위 50% 내 흑인 비율이 크게 감소하여, 이는 반전 효과를 잘 보여줌.
- 알고리즘이 관측된 검색 데이터만으로 훈련된 경우에도 결과가 유지됨을 확인하여, 선택적 레이블링과 관측되지 않는 이질성 하에서 편향 반전 현상이 모델의 강건한 특성임을 입증함.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.