[논문 리뷰] Exploiting Machine Unlearning for Backdoor Attacks in Deep Learning System
이 논문은 기계 학습 철수 기법을 악용하여 깊이 학습 모델에 암묵적으로 백도어를 삽입하는 새로운 블랙박스 백도어 공격인 BAU를 제안한다. 유해 데이터와 보완 데이터를 훈련 세트에 주입한 후 보완 샘플에 대해 학습 철수 요청을 제출함으로써, 공격자는 점차적으로 백도어를 활성화시키며 탐지되는 것을 회피하면서도 철수 후 악성 예측의 성공률을 크게 높인다.
In recent years, the security issues of artificial intelligence have become increasingly prominent due to the rapid development of deep learning research and applications. Backdoor attack is an attack targeting the vulnerability of deep learning models, where hidden backdoors are activated by triggers embedded by the attacker, thereby outputting malicious predictions that may not align with the intended output for a given input. In this work, we propose a novel black-box backdoor attack based on machine unlearning. The attacker first augments the training set with carefully designed samples, including poison and mitigation data, to train a `benign' model. Then, the attacker posts unlearning requests for the mitigation samples to remove the impact of relevant data on the model, gradually activating the hidden backdoor. Since backdoors are implanted during the iterative unlearning process, it significantly increases the computational overhead of existing defense methods for backdoor detection or mitigation. To address this new security threat, we proposes two methods for detecting or mitigating such malicious unlearning requests. We conduct the experiment in both exact unlearning and approximate unlearning (i.e., SISA) settings. Experimental results indicate that: 1) our attack approach can successfully implant backdoor into the model, and sharding increases the difficult of attack; 2) our detection algorithms are effective in identifying the mitigation samples, while sharding reduces the effectiveness of our detection algorithms.
연구 동기 및 목표
- 깊이 학습 시스템에서 기계 학습 철수 메커니즘이 초래하는 보안 위험을 조사하는 것.
- 기계 학습 철수가 개인정보 보호 도구로만 기능하는 것이 아니라, 암묵적으로 백도어를 삽입하는 데 악용될 수 있음을 입증하는 것.
- 학습 철수 기반 백도어 공격을 탐지하고 대응하는 방법을 개발하는 것.
- 정확한 철수 및 근사 철수(SISA) 설정 모두에서 제안된 공격의 효과성을 평가하는 것.
- 데이터 분할이 공격 탐지 가능성과 성공률, 그리고 방어 메커니즘에 미치는 영향을 분석하는 것.
제안 방법
- 공격자는 먼저 독성 샘플(타겟 클래스로 레이블링됨)과 보완 샘플(정확한 클래스로 레이블링됨)이 포함된 데이터셋을 기반으로 정상 모델을 훈련시킨다.
- 보완 샘플은 청소된 데이터와 구별이 불가능하도록 철저히 설계되었지만, 학습 철수 요청의 대상으로 사용된다.
- 공격자는 보완 샘플에 대해 다수의 학습 철수 요청을 제출함으로써 모델이 그들의 영향을 점차 잊고 결정 경계를 백도어를 유리하게 재구성하도록 유도한다.
- 백도어는 학습 철수 과정 중에 활성화되며, 모델의 파라미터가 트리거를 포함한 입력을 잘못 분류하도록 이동한다.
- 두 가지 방어 메커니즘을 제안한다: 제거된 샘플의 영향을 분석하여 이상 징후가 있는 학습 철수 요청을 식별하는 방법과, 影향 함수를 사용해 보완 샘플을 탐지하는 방법.
- 공격은 정확한 학습 철수와 SISA(근사 학습 철수) 설정 모두에서 평가되며, SISA는 데이터 분할과 슬라이스 기반 재훈련을 사용한다.
실험 결과
연구 질문
- RQ1기계 학습 철수가 초기 탐지 없이 깊이 학습 모델에 암묵적으로 백도어를 삽입하는 데 악용될 수 있는가?
- RQ2제안된 BAU 공격는 초기 공격 성공률을 낮추면서도 철수 후 백도어 성공률을 얼마나 효과적으로 높이는가?
- RQ3SISA와 같은 학습 철수 시스템에서의 데이터 분할은 학습 철수 기반 백도어 탐지 메커니즘의 효과성을 어느 정도 감소시키는가?
- RQ4영향 기반 또는 샘플 영향 분석은 보완 샘플을 대상으로 하는 악성 학습 철수 요청을 효과적으로 탐지할 수 있는가?
- RQ5제안된 방어 메커니즘은 학습 철수 기반 공격의 맥락에서 기존의 백도어 탐지 기법과 비교해 어떻게 성능을 발휘하는가?
주요 결과
- BAU 공격는 학습 철수 요청을 통해 모델에 백도어를 성공적으로 삽입하였으며, 보완 샘플 철수 후 공격 성공률가 크게 증가하였다.
- 초기 모델은 낮은 공격 성공률를 보였기 때문에, 기존의 백도어 탐지 기법으로는 철수 이전에 악성 행동을 식별하기 어려웠다.
- SISA 학습 철수 프레임워크에서의 데이터 분할은 계산 오버헤드를 증가시키며, 제안된 탐지 알고리즘의 효과성도 감소시켰다.
- 영향 분석을 통해 보완 샘플을 식별하는 탐지 방법은 분할되지 않은 환경에서 악성 학습 철수 요청을 효과적으로 식별하는 데 성공하였다.
- 영향 함수 기반 방어 메커니즘은 공격에 사용된 보완 샘플을 성공적으로 식별하여, 학습 철수 기반 백도어 확산을 탐지하는 데의 가능성을 입증하였다.
- 공격는 정확한 학습 철수와 근사 학습 철수(SISA) 설정 모두에서 효과적이었으며, 현재의 학습 철수 프레임워크가 악성 조작에 취약함을 보여주었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.