Skip to main content
QUICK REVIEW

[논문 리뷰] Verifying Individual Fairness in Machine Learning Models

Philips George John, Deepak Vijaykeerthy|arXiv (Cornell University)|2020. 06. 21.
Adversarial Robustness in Machine LearningComputer Science참고 문헌 33인용 수 17
한 줄 요약

이 논문은 유연한 속성 기반 거리 측정법에 따라 유사한 입력이 유사한 예측을 받는지 확인하는 전역적 내구성 검사를 통해 기계 학습 모델에서 개인적 공정성(Individual Fairness)을 검증하는 데 있어 최초의 프레임워크를 제안한다. 선형 및 커널 기반 분류기(다항식/RBF)에 대해 정확하지만 완전하지 않은 검증 알고리즘을 도입하며, 예측 차이를 구속하기 위해 정수형 프로그래밍(SDP) 근사 기법을 사용한다. 공개 데이터셋을 대상으로 한 실험적 검증을 통해 개인적 편향을 효과적으로 탐지함을 보여준다.

ABSTRACT

We consider the problem of whether a given decision model, working with structured data, has individual fairness. Following the work of Dwork, a model is individually biased (or unfair) if there is a pair of valid inputs which are close to each other (according to an appropriate metric) but are treated differently by the model (different class label, or large difference in output), and it is unbiased (or fair) if no such pair exists. Our objective is to construct verifiers for proving individual fairness of a given model, and we do so by considering appropriate relaxations of the problem. We construct verifiers which are sound but not complete for linear classifiers, and kernelized polynomial/radial basis function classifiers. We also report the experimental results of evaluating our proposed algorithms on publicly available datasets.

연구 동기 및 목표

  • 개인적 공정성에 대한 검증 기법의 부재를 해결하기 위해, 그룹 수준의 공정성이나 국소적 적대적 내구성 외에 모든 입력에 대한 전역적 내구성 요구 사항을 충족하는 방법을 제안한다.
  • 가까운 입력(탄력적인 메트릭 기반)이 유의미하게 다른 모델 출력을 내놓는지 확인함으로써 개인적 편향을 탐지할 수 있는 공식적이고 정확한 검증 방법을 개발한다.
  • 이전에 국소적 내구성 또는 그룹 공정성에 국한된 검증 기법을 전역적이고 개인적 공정성 설정으로 확장한다.
  • 특히 정수형 프로그래밍을 활용한 수학적 최적화 기반으로 백박스 모델의 공정성 검증을 위한 실용적인 프레임워크를 제공한다.
  • 공개 데이터셋을 대상으로 실험적으로 방법을 평가하여 실제 모델에서 개인 수준의 불공정성을 탐지할 수 있음을 입증한다.

제안 방법

  • 논문은 입력 속성을 부분집합으로 나누고, 각 부분집합에 대해 허용 가능한 변형 기준을 설정하는 탄력적인 메트릭을 정의함으로써 개인적 공정성을 정의한다. 이는 각 속성의 차이가 해당 기준 내에 있을 경우 입력이 유사하다고 간주함을 의미한다.
  • 선형 분류기의 경우 검증 문제는 선형 프로그래밍으로 축소되며, 이는 정확하지만 시간 복잡도가 지수적일 수 있다. 커널 기반 모델의 경우, 다항식 최적화 기법(SOS)을 활용해 정수형 프로그래밍(SDP)으로 근사한다.
  • 핵심 방법은 정수형 프로그래밍 근사 기법을 사용해 가까운 입력 간의 최대 출력 차이에 대한 하한을 계산함으로써 공정성 검증을 정확하게 수행한다.
  • RBF 커널 모델의 경우, 민감한 속성 공간 내에서 가능한 입력 변형 쌍을 반복적으로 탐색하고, 최소 출력 차이를 찾기 위해 제약 조건이 있는 최적화 문제를 해결한다.
  • 정확성을 확보하기 위해 Putinar의 Positivstellensatz와 SOS 계층 구조를 활용하여 다항식 최적화 문제에 대해 반대기하집합 위에서 하한을 구성한다.
  • 프레임워크는 가까운 입력 간의 최대 출력 차이에 대한 하한을 출력하며, 이 값이 공정성 기준을 초과할 경우 반례(counterexample)도 함께 제공한다.

실험 결과

연구 질문

  • RQ1모든 입력 쌍에 대한 전역적 내구성 검사를 통해 기계 학습 모델에서 개인적 공정성을 공식적으로 검증할 수 있는가?
  • RQ2이전에 국소적 적대적 내구성 또는 그룹 공정성에 대해 설계된 검증 기법을 어떻게 전역적이고 개인적 공정성 설정으로 일반화할 수 있는가?
  • RQ3비선형 모델, 예를 들어 커널 기반 분류기에서 개인적 공정성을 정확하게 검증하기 위해 어떤 수학적 근사 기법을 사용할 수 있는가?
  • RQ4정수형 프로그래밍과 다항식 최적화 기법(SOS)을 사용해 입력 변형에 따른 예측 차이를 얼마나 잘 구속할 수 있는가?
  • RQ5제안된 프레임워크는 실제 데이터셋에서 개인 수준의 편향을 탐지하는 데 얼마나 효과적인가?

주요 결과

  • 제안된 검증 프레임워크는 선형 및 커널 기반 분류기에서 정확하지만 완전하지 않으며, 선형 모델의 경우 정확한 검증이 지수 시간 복잡도로 가능하다.
  • 커널 기반 모델의 경우, 다항식 최적화 기법(SOS) 기반 정수형 프로그래밍(SDP) 근사 기법을 사용해 가까운 입력 간의 최대 출력 차이에 대한 하한을 계산한다.
  • RBF 커널 모델에서 프레임워크는 작은 입력 변형에도 불구하고 큰 출력 차이를 보이는 입력 쌍을 식별함으로써 개인적 편향을 성공적으로 탐지한다.
  • 공개 데이터셋을 대상으로 한 실험적 평가를 통해 방법이 불공정한 예측을 식별할 수 있음을 확인하였으며, 출력 하한은 최악의 경우 공정성 위반 상황을 반영한다.
  • 기존의 공정성 정의를 일반화하여, 탄력적인 메트릭 기반 프레임워크에 의해 그룹 공정성과 반사적 공정성(Counterfactual Fairness)이 모두 포함된다.
  • Putinar의 Positivstellensatz의 사용은 복잡한 입력 제약 조건이 존재하는 상황에서도 제약 조건이 있는 최적화 문제를 수행할 수 있게 하여 공정성 검증이 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.