[논문 리뷰] Fairwashing: the risk of rationalization
이 논문은 '정의의 허영'(fairwashing)을 도입한다—즉, 본질적으로 부정확한 블랙박스 기계학습 모델에서 정의가 있다고 잘못 인식시키기 위해 모델 설명을 위장하여 사용하는 것이다. 저자들은 불공정한 블랙박스 모델로부터 공정하고 고정밀도의 서rogate 모델을 생성하는 정규화된 규칙 목록 탐색 알고리즘인 LaundryML을 제안하며, 실증적 평가를 통해 이러한 합리화된 설명이 원본 모델에 대한 정밀도를 유지하면서도 부정확성을 크게 감소시킬 수 있음을 보여준다.
Black-box explanation is the problem of explaining how a machine learning model -- whose internal logic is hidden to the auditor and generally complex -- produces its outcomes. Current approaches for solving this problem include model explanation, outcome explanation as well as model inspection. While these techniques can be beneficial by providing interpretability, they can be used in a negative manner to perform fairwashing, which we define as promoting the false perception that a machine learning model respects some ethical values. In particular, we demonstrate that it is possible to systematically rationalize decisions taken by an unfair black-box model using the model explanation as well as the outcome explanation approaches with a given fairness metric. Our solution, LaundryML, is based on a regularized rule list enumeration algorithm whose objective is to search for fair rule lists approximating an unfair black-box model. We empirically evaluate our rationalization technique on black-box models trained on real-world datasets and show that one can obtain rule lists with high fidelity to the black-box model while being considerably less unfair at the same time.
연구 동기 및 목표
- 불공정한 모델이 윤리적이라고 잘못 인식시키기 위해 모델 설명을 위장하여 사용하는 '정의의 허영'의 위험을 폭 드러내기.
- 블랙박스 설명이 체계적으로 조작되어 불공정한 결정이 공정한 것으로 합리화될 수 있음을 보여주기.
- 불공정한 블랙박스 모델로부터 해석 가능하고 고정밀도의 서rogate 모델을 생성하기 위한 일반적이고 공정성 제약이 있는 방법 개발하기.
- 실증적으로 이러한 합리화된 설명이 원본 모델보다 훨씬 낮은 부정확성을 달성하면서도 고정밀도를 유지할 수 있음을 검증하기.
- 후행 설명의 정확성 검증 없이 의존할 경우 기계학습 공동체가 겪을 수 있는 윤리적 위험에 대한 경각심 제고하기.
제안 방법
- 블랙박스 모델에 대한 정밀도와 정의성에 따라 정의된 지표를 기반으로 최적화하는 정규화된 규칙 목록 탐색 알고리즘인 LaundryML을 제안한다.
- 이중 목표 최적화를 사용한다: 블랙박스 모델에 대한 정밀도를 최대화하고, 부정확성을 최소화하며, 이는 정의성 정규화 파라미터 β로 제어된다.
- 전역(모델 설명) 및 국소(결과 설명) 서rogate 모델을 생성하기 위해 알고리즘을 적용하여, 두 수준에서 모두 합리화를 가능하게 한다.
- 정밀도와 정의성 제약 조건을 기반으로 후보를 점진적으로 잘라내고 개선하는 탐욕적이고 반복적인 규칙 목록 탐색을 수행한다.
- 전체 데이터셋 또는 개별 인스턴스에 따라 최적화를 적응시켜 전역 및 국소 설명 합리화를 모두 지원한다.
- 기본 블랙박스 모델과 정의성 지표에 대해 독립적이므로 일반성과 적용 범위가 넓다.
실험 결과
연구 질문
- RQ1후행 설명이 본질적으로 불공정한 블랙박스 모델에서 정의가 있다고 잘못 인식시키기 위해 체계적으로 조작될 수 있는가?
- RQ2불공정한 블랙박스 모델에 대해 매우 높은 정밀도를 유지하면서도 원본보다 훨씬 더 공정한 서rogate 모델을 얼마나 달성할 수 있는가?
- RQ3블랙박스 액세스만으로 불공정한 결정을 정당화하는 해석 가능한 규칙 목록을 생성하는 것이 가능한가?
- RQ4정밀도와 정의성 간의 상호보완적 관계가 합리화 과정에서 어떻게 나타나는가?
- RQ5합리화된 설명은 위장된 것으로 감지될 수 있는가, 아니면 진정된 정의성과 구분이 불가능한가?
주요 결과
- Adult Income 데이터셋에서 최고의 합리화된 모델은 정밀도 0.908과 부정확성 0.058을 기록했으며, 원본 블랙박스 모델 대비 부정확성이 50% 이상 감소했다.
- ProPublica Recidivism 데이터셋에서 최고의 모델은 정밀도 0.748과 부정확성 0.080을 기록했으며, 다시 한번 부정확성이 상당히 감소했다.
- 국소 결과 설명의 경우, β = 0.9일 때, Adult Income 데이터셋의 소수자 집단에서 기각된 모든 사용자에 대해 완전히 공정한 모델(부정확성 = 0.0)이 결정을 설명할 수 있었다.
- 두 데이터셋 모두에서 FairML의 상대적 특성 중요도 순위가 크게 변화했다: 민감한 속성(예: 성별, 인종)이 합리화된 모델에서 상위에서 하위로 이동했다.
- β = 0.9일 때, 합리화된 모델이 블랙박스 결정과 일치하는 소수자 집단 사용자의 비율이 100%에 도달했으며, 이는 강력한 커버리지와 일관성을 의미한다.
- 합리화된 모델는 특정 '소송 대상 집단'에 특화되어 있어, 새로운 미사용 소수자 집단에 대해서는 정밀도가 떨어질 수 있으며, 이는 위장 탐지의 잠재적 과제를 드러낸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.