[논문 리뷰] Feature Attributions and Counterfactual Explanations Can Be Manipulated
이 논문은 특성 기여도 방법(예: LIME, SHAP)과 반대 조건 설명(예: Wachter의 알고리즘, DiCE)이 악성 사용자에 의해 모델 편향을 숨기도록 조작될 수 있음을 보여준다. 특별히 설계된 목적 함수로 편향된 모델을 훈련시켜 설명이 공정하고 편향이 없어 보이게 만들었을 때, 기반 모델이 보호 그룹에 대해 체계적으로 불리하게 작동함에도 불구하고, 이러한 현상이 숨겨진다.
As machine learning models are increasingly used in critical decision-making settings (e.g., healthcare, finance), there has been a growing emphasis on developing methods to explain model predictions. Such extit{explanations} are used to understand and establish trust in models and are vital components in machine learning pipelines. Though explanations are a critical piece in these systems, there is little understanding about how they are vulnerable to manipulation by adversaries. In this paper, we discuss how two broad classes of explanations are vulnerable to manipulation. We demonstrate how adversaries can design biased models that manipulate model agnostic feature attribution methods (e.g., LIME \& SHAP) and counterfactual explanations that hill-climb during the counterfactual search (e.g., Wachter's Algorithm \& DiCE) into extit{concealing} the model's biases. These vulnerabilities allow an adversary to deploy a biased model, yet explanations will not reveal this bias, thereby deceiving stakeholders into trusting the model. We evaluate the manipulations on real world data sets, including COMPAS and Communities \& Crime, and find explanations can be manipulated in practice.
연구 동기 및 목표
- 후행 설명 방법—특히 특성 기여도 및 반대 조건 설명—이 모델 편향을 숨기도록 조작될 수 있는지 조사하기.
- 악성 사용자가 예측에서 본질적으로 불공정한 모델을 훈련시켜도 설명에서는 공정하게 보이게 만들 수 있음을 입증하기.
- 최신의 설명 방법을 사용하여 실세계 데이터셋(COM-PAS, Communities & Crime)이 이러한 조작에 얼마나 취약한지 평가하기.
- 반대 조건 설명이 비보호 그룹에 대해 저비용의 구제 조치를 제공하도록 조작될 수 있으며, 원래 데이터에서는 공정하게 보이게 만들 수 있음을 보여주기.
제안 방법
- 모델 분류 손실을 최소화하고, 반대 조건 설명에서의 공정성을 확보하며, 입력 공간에서의 작은 변형을 강제하는 이중 최적화 목적 함수 설계하기.
- 흑상자 반대 조건 알고리즘(예: Wachter의 알고리즘, DiCE)을 훈련 중에 암묵적 미분을 통해 역전파하기.
- 반대 조건 구제의 공정성, 변형 유도 비용 감소에 의한 부정확성, 그리고 작은 변형 제약 조건을 포함한 손실 함수를 사용해 신경망 모델 훈련하기.
- 비보호 인스턴스에 학습된 변형 벡터 δ를 적용하여 반대 조건의 비용을 줄이되, 원래 데이터에서의 구제 비용 격차는 낮게 유지하기.
- 비보호 그룹과 보호 그룹 간 평균 구제 비용 격차(공정성 격차)와 변형 후 대비 전 비용 감소 비율을 사용해 모델 평가하기.
- 실세계 데이터셋(Communities & Crime, COMPAS)을 사용하고, LIME, SHAP, Wachter의 알고리즘, 스파arsity Wachter, DiCE, 프로토타입 유도 반대 조건을 평가하기.
실험 결과
연구 질문
- RQ1악성 사용자가 특성 기여도(예: LIME, SHAP)에서 공정하게 보이게 만들 수 있는 기계 학습 모델을 설계할 수 있는가?
- RQ2반대 조건 설명 방법이 비보호 그룹에 대해 저비용의 구제 조치를 제공하도록 조작될 수 있으며, 원래 데이터에서는 공정하게 보이게 만들 수 있는가?
- RQ3작은 입력 변형에 대해 기울기 상승 기반 반대 조건 알고리즘(예: Wachter의 알고리즘, DiCE)이 어떻게 다른 결과를 낼 수 있는가? 이는 조작 가능성을 제공하는가?
- RQ4제안된 조작 전략이 실세계 데이터셋에서 설명의 충실도와 구제 비용 격차 측면에서 실제로 얼마나 효과적인가?
주요 결과
- 조작된 모델은 Communities & Crime에서 기준 모델의 1% 이내 정확도를 달성하여 성능 저하가 최소화됨을 확인함.
- 원래 데이터에서 보호 그룹과 비보호 그룹 간 평균 구제 비용 격차는 매우 작았음(예: Wachter의 알고리즘 0.37, DiCE 6.99), 즉 공정하게 보임.
- 변형 δ를 적용한 후 비보호 그룹의 구제 비용은 크게 감소했으며, Wachter의 알고리즘의 경우 비용 감소 비율이 최대 20.1배에 달함.
- DiCE의 경우 비용 감소 비율이 4.5배였으며, 이는 조작 후 비보호 개인이 쉽게 저비용의 구제 조치를 확보할 수 있음을 보여줌.
- 결과적으로 반대 조건 설명이 숨겨진 편향을 숨기도록 조작될 수 있음을 입증하였으며, 이는 설명에서는 공정하게 보이나 실질적으로는 불공정한 모델을 만들 수 있음을 의미함.
- 이 조작 전략은 Wachter의 알고리즘, DiCE, 프로토타입 유도 방법을 포함한 여러 반대 조건 알고리즘에 대해 효과적이며, 광범위한 취약성을 보여줌.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.