Skip to main content
QUICK REVIEW

[논문 리뷰] Characterizing the risk of fairwashing

Ulrich Aïvodji, Hiromi Arai|arXiv (Cornell University)|2021. 06. 14.
Law, Economics, and Judicial Systems인용 수 7
한 줄 요약

이 논문은 설명의 정밀도-불공정성 트레이드오프를 분석함으로써, 불공정한 백박스 모델을 조작된 공정한 모습의 설명으로 합리화하는 '공정성 위장 공격(fairwashing)'의 위험을 조사한다. 이는 공정성 위장 설명이 집단 간으로 일반화되고 모델 간으로 전이됨을 보여주며, 탐지가 매우 어렵다는 것을 입증한다. 또한 공정성의 라슈미편 집합(Fairness In The Rashomon Set, FaiRS) 프레임워크를 활용한 위험 정량화 방법을 제안한다.

ABSTRACT

Fairwashing refers to the risk that an unfair black-box model can be explained by a fairer model through post-hoc explanation manipulation. In this paper, we investigate the capability of fairwashing attacks by analyzing their fidelity-unfairness trade-offs. In particular, we show that fairwashed explanation models can generalize beyond the suing group (i.e., data points that are being explained), meaning that a fairwashed explainer can be used to rationalize subsequent unfair decisions of a black-box model. We also demonstrate that fairwashing attacks can transfer across black-box models, meaning that other black-box models can perform fairwashing without explicitly using their predictions. This generalization and transferability of fairwashing attacks imply that their detection will be difficult in practice. Finally, we propose an approach to quantify the risk of fairwashing, which is based on the computation of the range of the unfairness of high-fidelity explainers.

연구 동기 및 목표

  • 사후 설명 시스템에서 공정성 위장 공격의 조작 가능성 조사
  • 공정성 위장 설명이 타겟 집단 외의 다른 인구 집단으로도 일반화되는지 평가
  • 재학습 없이도 다양한 백박스 모델 간에 공정성 위장 공격이 전이되는지 평가
  • 공정성의 라슈미편 집합(FaiRS) 프레임워크를 활용한 공정성 위장 위험 정량화 방법 제안
  • 정밀도 기반 탐지 방법의 한계를 보여줌으로써, 이 방법의 타당성에 도전

제안 방법

  • 저자들은 설명의 정밀도와 공정성 제약 조건을 균형 잡는 다목적 최적화 문제를 해결하기 위해 ϵ-제약 방법을 사용한다.
  • 규칙 목록, 로지스틱 회귀 등의 서rogate 모델을 훈련하여 백박스 모델을 설명하면서 공정성 제약 조건(예: 동일 기회, 통계적 평등)을 강제한다.
  • 일반화 평가는 비타겟 집단에서 공정성 위장 설명의 정밀도를 측정하고, 원래(소송 제기) 집단의 정밀도와 비교함으로써 평가한다.
  • 전이 가능성 평가는 동일한 공정성 위장 설명을 다른 백박스 모델에 적용하여, 새로운 모델에서의 정밀도와 불공정성 수준을 측정함으로써 평가한다.
  • 위험 정량화는 라슈미편 집합 내 고정밀도 설명들에서의 불공정성 범위를 계산하는 FaiRS 프레임워크를 사용하여 수행된다.
  • 실험은 여러 데이터셋(Adult Income, COMPAS, Default Credit, Marketing), 백박스 모델(AdaBoost, DNN, RF, XGBoost), 공정성 기준(EOdds, EOpp, PE, SP)을 대상으로 수행된다.

실험 결과

연구 질문

  • RQ1공정성 위장 설명은 특정하게 합리화하기 위해 설계된 집단 외부로도 일반화되는가?
  • RQ2재학습 없이도 한 백박스 모델에서 다른 백박스 모델로 공정성 위장 공격이 전이되는가, 즉 새로운 모델의 예측에 접근할 수 없더라도 말이다?
  • RQ3정밀도만으로는 공정성 위장 공격을 신뢰할 만한 지표로 사용할 수 있는가?
  • RQ4공정성의 라슈미편 집합(FaiRS) 프레임워크는 공정성 위장의 위험을 효과적으로 정량화할 수 있는가?
  • RQ5고정밀도 설명들 내에서 불공정성의 범위는 무엇이며, 이는 조작 가능성과 어떻게 관련되는가?

주요 결과

  • 공정성 위장 설명은 소송 제기 집단 외부로도 일반화되며, 비타겟 집단에서의 정밀도가 원래 집단과 유사하여 광범위한 합리화 능력을 보임.
  • 공정성 위장 공격은 다양한 백박스 모델 간에 전이되며, 동일하지 않은 모델들에서도 동일한 설명이 높은 정밀도를 유지함.
  • 다양한 데이터셋과 공정성 제약 조건에서 공정성 위장 설명의 정밀도가 매우 높게 유지됨(예: >0.94), 이는 강력한 조작 가능성 존재를 시사.
  • 정밀도 기반의 공정성 위장 탐지 방법은 공격의 높은 일반화성과 전이 가능성으로 인해 효과가 없으며, 이는 다양한 집단과 모델에서 일관되게 높은 정밀도 점수를 기록함으로써 입증됨.
  • FaiRS 프레임워크는 고정밀도 설명들 내 불공정성의 범위를 드러내어 공정성 위장의 위험을 성공적으로 정량화함으로써, 정밀도 중심 지표의 대안으로 강력한 성능을 보임.
  • 마케팅 데이터셋에서 ϵ=0.03일 때, 모든 모델과 공정성 기준에서 정밀도가 0.94 이상 유지되었으며, 불공정성 값은 항상 0.03 이하로 유지되어 공격에 대한 강력한 내성성을 보임.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.