[논문 리뷰] Hidden Poison: Machine Unlearning Enables Camouflaged Poisoning Attacks
이 논문은 탐지에 대비해 은폐된 독성 데이터 포인트를 훈련 세트에 주입하는 침투성 데이터 오염 공격을 소개한다. 모델 훈련 후, 은폐 포인트가 제거되는 언러닝 요청이 발생하면, 이는 표적 오분류를 유도한다. 이는 기울기 일치 기반 오염 공격을 사용하여 CIFAR-10, Imagenette, Imagewoof에서 효과적으로 입증되었다.
We introduce camouflaged data poisoning attacks, a new attack vector that arises in the context of machine unlearning and other settings when model retraining may be induced. An adversary first adds a few carefully crafted points to the training dataset such that the impact on the model's predictions is minimal. The adversary subsequently triggers a request to remove a subset of the introduced points at which point the attack is unleashed and the model's predictions are negatively affected. In particular, we consider clean-label targeted attacks (in which the goal is to cause the model to misclassify a specific test point) on datasets including CIFAR-10, Imagenette, and Imagewoof. This attack is realized by constructing camouflage datapoints that mask the effect of a poisoned dataset.
연구 동기 및 목표
- 동적 기계 학습 파이프라인에서 데이터 언러닝이 지원되는 새로운 공격 벡터를 드러내는 것.
- 공격자가 훈련 중 탐지되는 것을 피하기 위해 은폐 포인트에 의해 가림된 독성 포인트를 주입할 수 있음을 보여주는 것.
- 개인정보 보호를 향상시키기 위해 의도된 언러닝 요청이, 숨겨진 오염 효과를 활성화하는 데 악용될 수 있음을 보여주는 것.
- 데이터 증강, 무작위 삭제, 모델 이식성 조건 하에서 공격의 강건성을 평가하는 것.
- 정확한 언러닝과 근사 언러닝 설정 모두에서 이러한 공격의 가능성과 영향을 탐색하는 것.
제안 방법
- 공격는 두 단계로 진행된다: 먼저, 모델 훈련 이전에 독성 포인트와 은폐 포인트를 훈련 데이터에 추가한다.
- 은폐 포인트는 기울기 일치 기법을 사용해 생성되며, 독성 포인트의 영향을 상쇄시켜 정상 훈련과 유사한 모델 동작을 유지한다.
- 정상 데이터 + 독성 포인트 + 은폐 포인트로 구성된 증강된 데이터셋에서 모델을 훈련시켜 표적 포인트에 대해 높은 정확도를 유지한다.
- 훈련 후, 은폐 포인트 세트를 제거하기 위한 언러닝 요청을 실행한다.
- 결과적으로 남은 독성 포인트의 잔여 효과로 인해 표적 오분류가 발생한다.
- 독성/은폐 포인트 생성 과정에서 새로운 샘플에 대한 모델 기울기 쿼리를 활용하며, 이는 회색 상자 액세스 권한이 필요하다.
실험 결과
연구 질문
- RQ1훈련 중에는 정상적으로 행동하지만 언러닝 후에 성능이 떨어지는, 훈련 세트 내에 은폐된 데이터 오염 공격이 가능할 수 있는가?
- RQ2독성 및 은폐 포인트를 생성하는 데 사용된 모델과 다른 모델을 대상으로 공격이 얼마나 효과적인가?
- RQ3데이터 증강 및 독성/은폐 샘플의 무작위 삭제 조건 하에서 공격가 지속 가능한가?
- RQ4여러 표적 이미지에 대한 기울기 일치를 통해 다중 표적 공격으로 확장할 수 있는가?
- RQ5재학습을 처음부터 수행하지 않는 근사 언러닝 설정에서도 공격가 효과적인가?
주요 결과
- 은폐된 오염 공격은 언러닝 수행 후 CIFAR-10, Imagenette, Imagewoof에서 표적 오분류를 성공적으로 유도한다.
- 공격는 데이터 증강 및 생성된 독성 및 은폐 포인트의 무작위 삭제 조건 하에서도 강건성을 유지한다.
- 공격는 대상 모델이 독성 및 은폐 포인트 생성에 사용된 모델과 다를 경우에도 강력한 이식성을 보여준다.
- 절단 실험 결과, 공격 성공은 독성 및 은폐 세트 크기 간의 균형에 의존하며, 특정 $b_p$ 및 $b_c$ 값에서 최적 성능를 보인다.
- 재학습을 처음부터 수행하는 언러닝 조건에서도 공격가 효과적이며, 이는 결과 모델이 재학습된 모델와 통계적으로 구분되지 않는 한, 근사 언러닝 조건에서도 작동할 것임을 시사한다.
- 공격는 블랙박스가 아니며, 공격자가 대상 모델의 기울기 쿼리를 필요로 하므로, 향후 블랙박스 변형에 대한 추가 연구가 필요하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.