Skip to main content
QUICK REVIEW

[논문 리뷰] Model extraction from counterfactual explanations

Ulrich Aïvodji, Alexandre Bolot|arXiv (Cornell University)|2020. 09. 03.
Adversarial Robustness in Machine Learning참고 문헌 89인용 수 20
한 줄 요약

이 논문은 설명 가능 AI 시스템의 투명성 향상을 위해 널리 사용되는 역사적 설명이, 낮은 쿼리 예산으로도 고정밀도·고정확도의 모델 추출 공격을 수행할 수 있도록 악용될 수 있음을 입증한다. 공격자는 예측을 변화시키는 변형된 입력 인스턴스를 활용하여, 대상 블랙박스 모델을 정확히 모방하는 서rogate 모델을 재구성할 수 있으며, 이는 설명 가능 AI 시스템에서 중요한 프라이버시 위험을 드러낸다.

ABSTRACT

Post-hoc explanation techniques refer to a posteriori methods that can be used to explain how black-box machine learning models produce their outcomes. Among post-hoc explanation techniques, counterfactual explanations are becoming one of the most popular methods to achieve this objective. In particular, in addition to highlighting the most important features used by the black-box model, they provide users with actionable explanations in the form of data instances that would have received a different outcome. Nonetheless, by doing so, they also leak non-trivial information about the model itself, which raises privacy issues. In this work, we demonstrate how an adversary can leverage the information provided by counterfactual explanations to build high-fidelity and high-accuracy model extraction attacks. More precisely, our attack enables the adversary to build a faithful copy of a target model by accessing its counterfactual explanations. The empirical evaluation of the proposed attack on black-box models trained on real-world datasets demonstrates that they can achieve high-fidelity and high-accuracy extraction even under low query budgets.

연구 동기 및 목표

  • 역사적 설명이 모델 투명성을 위해 고안되었지만, 이로 인해 민감한 모델 정보가 유출될 수 있는지 조사하기 위해.
  • 쿼리 인터페이스로만 역사적 설명을 사용하는 경우 모델 추출 공격의 가능성 분석을 위해.
  • 학습 데이터 및 모델 아키텍처에 대한 사전 지식에 따라 변하는 공격자의 가정 조건 하에서 이러한 공격의 성능 평가를 위해.
  • 후행 설명 시스템에서 설명의 현실성(다양성, 내성성)과 모델 프라이버시 간의 트레이드오프를 탐색하기 위해.
  • 프라이버시 보존 기계학습에 대한 영향을 평가하고, 쿼리 빈도 모니터링 및 워터마킹과 같은 기존 방어 기법의 한계를 분석하기 위해.

제안 방법

  • 공격자는 블랙박스 모델에 쿼리하여, 모델의 예측를 변화시키는 변형된 입력(역사적 설명)을 확보한다.
  • 공격자는 이러한 역사적 설명을 학습 데이터로 사용하여, 표적 모델의 행동을 재현하고자 하는 목적의 지도학습을 통해 서rogate 모델을 훈련시킨다.
  • 학습 데이터 분포, 모델 아키텍처, 설명 생성 과정에서 학습 데이터의 사용 여부 등에 따라 다양한 수준의 사전 지식을 가진 공격자 모델을 정의한다.
  • 실제 공격 상황을 반영하기 위해 낮은 쿼리 예산 조건에서 공격를 평가한다.
  • 성능는 서rogate 모델의 정확도 및 피요도(예: 표적 모델과의 예측 유사도) 기준으로 측정된다.
  • 실세계 데이터셋을 사용하여 랜덤 포레스트 및 신경망과 같은 블랙박스 모델에서 방법을 테스트한다.

실험 결과

연구 질문

  • RQ1역사적 설명을 활용하여 블랙박스 모델에 대해 고정밀도 모델 추출 공격을 수행할 수 있는가?
  • RQ2공격자의 사전 지식(예: 학습 데이터 분포, 모델 아키텍처)이 모델 추출 성공에 어떤 영향을 미치는가?
  • RQ3역사적 설명의 다양성이 추출된 서rogate 모델의 품질을 향상시키는가?
  • RQ4낮은 쿼리 예산으로도 모델 추출을 달성할 수 있는가? 이는 공격의 스텔스성과 탐지 어려움을 의미한다.
  • RQ5실제로 신뢰할 수 있는 설명과 모델 프라이버시 유출 위험 간의 갈등은 무엇인가?

주요 결과

  • 제안된 모델 추출 공격는 낮은 쿼리 예산으로도 높은 정확도와 피요도를 달성하여, 도청 공격의 가능성과 효과성을 입증한다.
  • 이 공격는 실제 세계 데이터셋에서 랜덤 포레스트 및 신경망을 포함한 다양한 블랙박스 모델에 대해 효과적이며, 성공을 거둔다.
  • 신뢰성 있는 설명을 위해 역사적 설명의 다양성이 요구될 경우, 공격 성능이 향상됨을 확인하여, 설명 품질과 공격 성공 간의 직접적인 연관성을 입증한다.
  • 학습 데이터나 아키텍처에 대한 사전 지식 없이도 공격자는 표적 모델의 행동을 정확히 모방하는 서rogate 모델을 재구성할 수 있다.
  • 쿼리 빈도 모니터링 및 워터마킹과 같은 기존 방어 기법은 이 공격에 효과적이지 않다. 이는 공격의 쿼리 수가 적고, 비적응형이기 때문이다.
  • 결과적으로, 현실적이고 신뢰할 수 있는 설명을 통한 투명성과 프라이버시 간의 근본적인 갈등이 드러나며, 더 정확하고 다양한 설명일수록 모델 추출 위험이 증가함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.