Skip to main content
QUICK REVIEW

[논문 리뷰] Hunting for Discriminatory Proxies in Linear Regression Models

Samuel Yeom, Anupam Datta|arXiv (Cornell University)|2018. 10. 16.
Corruption and Economic Development인용 수 15
한 줄 요약

이 논문은 선형 회귀 모델에서 프록시 사용을 공식적으로 정의하며, 프록시는 보호 대상 속성과 통계적으로 상관관계가 있고 원인적 영향을 미치는 입력 변수의 조합이다. 저자들은 효율적인 볼록 최적화 방법—2차원 원형 프로그래밍을 해결하는 방법—을 제안하여 이러한 프록시를 탐지하고, 정당화된 면제 사항을 처리할 수 있도록 확장하여 실제 예측 경찰 데이터셋에서 차별적 패턴을 식별하는 데 효과성을 입증한다.

ABSTRACT

A machine learning model may exhibit discrimination when used to make decisions involving people. One potential cause for such outcomes is that the model uses a statistical proxy for a protected demographic attribute. In this paper we formulate a definition of proxy use for the setting of linear regression and present algorithms for detecting proxies. Our definition follows recent work on proxies in classification models, and characterizes a model's constituent behavior that: 1) correlates closely with a protected random variable, and 2) is causally influential in the overall behavior of the model. We show that proxies in linear regression models can be efficiently identified by solving a second-order cone program, and further extend this result to account for situations where the use of a certain input variable is justified as a `business necessity'. Finally, we present empirical results on two law enforcement datasets that exhibit varying degrees of racial disparity in prediction outcomes, demonstrating that proxies shed useful light on the causes of discriminatory behavior in models.

연구 동기 및 목표

  • 프록시가 보호 대상 속성과 상관관계가 있고 모델 출력에 영향을 미치는 기능 조합인 선형 회귀 모델에서 프록시 사용 개념을 공식화하는 것.
  • 특히 2차원 원형 프로그래밍을 사용하여 볼록 최적화를 통해 효율적이고 확장 가능한 알고리즘을 개발하여 이러한 프록시를 탐지하는 것.
  • 특정 변수들이 보호 대상 속성과 상관관계가 있더라도 정당한 이유로 사용되는 경우를 고려하여 탐지 방법을 확장하는 것.
  • 실제 예측 경찰 데이터셋을 대상으로 본 방법의 실증적 평가를 통해 차별적 결과의 근본 원인을 식별할 수 있는 능력을 평가하는 것.
  • 프록시 기반 차별성에 대한 기계 학습 모델을 감시하기 위한 실용적이고 계산적으로 실현 가능한 프레임워크를 제공하는 것.

제안 방법

  • 프록시를 보호 대상 속성과 높은 통계적 연관성을 보이고 모델 출력에 상당한 원인적 영향을 미치는 입력 변수의 선형 조합으로 정의한다.
  • 프록시 탐지를 제2차원 원형 프로그래밍(SOCP)으로 공식화하여, 볼록 최적화를 통해 효율적이고 정확한 프록시 계산이 가능하도록 한다.
  • KKT 행렬이 특이해지는 경우를 대비해 근사 탐지를 허용하는 완화 기법을 도입하여 통제된 거짓 경고 비율을 확보한다.
  • 면제된 변수에서 유도된 프록시를 제외하도록 최적화 프레임워크를 수정하여, 정당한 상관관계가 거짓 경고를 유발하지 않도록 한다.
  • 원인적 영향을 측정하기 위해, 프록시의 분산을 모델 출력에 대비하여 정의한 영향력 측도를 사용하여 그 차별적 잠재력의 정량화를 수행한다.
  • 알고리즘을 두 개의 예측 경찰 데이터셋에 적용하여 프록시 강도를 개별 기능의 상관관계와 모델 결과와 비교한다.

실험 결과

연구 질문

  • RQ1분류 모델에서의 프록시 사용 개념을 선형 회귀 모델으로 의미적으로 확장할 수 있는가?
  • RQ2볼록 최적화 기법을 사용하여 선형 회귀 모델에서 프록시를 효율적으로 탐지할 수 있는가?
  • RQ3차별적 영향을 유발하는 변수들이 보호 대상 속성과 상관관계가 있더라도 정당한 이유로 사용되는 경우를 고려하여 탐지 알고리즘을 어떻게 수정할 수 있는가?
  • RQ4식별된 프록시가 실제 예측 경찰 모델에서 비차별적 영향의 근본 원인을 어느 정도 설명하는가?
  • RQ5개별 기능의 상관관계와 복합 프록시 간의 차별적 영향력 간의 관계는 어떠한가?

주요 결과

  • 정확한 SOCP 솔버가 수렴할 경우, 제안된 알고리즘이 거짓 경고 없이 프록시를 탐지하여 차별적 행동의 신뢰성 있는 식별을 보장한다.
  • C&C 데이터셋에서 58개 변수로 구성된 프록시는 ε = 0.85일 때 영향력 0.34를 기록하여, 어떤 단일 기능보다도 크게 높은 영향력을 보였다.
  • 한 데이터셋에서는 가장 강력한 면제되지 않은 프록시가 가장 강력한 일반 프록시보다 훨씬 약했으며, 이는 단일 면제 변수가 대부분의 차별적 영향을 설명할 수 있음을 시사한다.
  • 모델에서 프록시의 영향력이 모델 자체의 분산보다 14.5배 더 높았으며, 이는 전체 모델에서의 상쇄 효과가 강력한 잠재적 프록시를 가리킬 수 있음을 보여준다.
  • 근사 탐지 알고리즘은 거짓 부정이 없지만, δ가 진짜 최대 영향력보다 초과할 경우 거짓 경고를 유발할 수 있어 민감도와 정밀도 사이의 상충 관계를 보여준다.
  • 실증 결과는 알고리즘이 매우 빠르게 작동하며 모델의 가장 문제적인 요소를 정확하게 식별함으로써 비차별적 영향의 원인에 대한 실행 가능한 통찰을 제공함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.