[논문 리뷰] Model Agnostic Defence against Backdoor Attacks in Machine Learning
NEO는 모델에 종속되지 않은 블랙박스 방어 프레임워크로, 체계적인 트리거 마스킹과 재구성 기반으로 백도어 트리거를 탐지하고 중화함으로써 이미지 분류 모델의 백도어 공격을 탐지하고 완화한다. 모델 가중치나 학습 데이터에 접근할 필요 없이도 평균 88%의 탐지율을 기록하며, 1장의 이미지당 4.4ms의 추론 시간을 기록하여 최신의 화이트박스 방어 기법들보다 뛰어난 성능을 보인다.
Machine Learning (ML) has automated a multitude of our day-to-day decision making domains such as education, employment and driving automation. The continued success of ML largely depends on our ability to trust the model we are using. Recently, a new class of attacks called Backdoor Attacks have been developed. These attacks undermine the user's trust in ML models. In this work, we present NEO, a model agnostic framework to detect and mitigate such backdoor attacks in image classification ML models. For a given image classification model, our approach analyses the inputs it receives and determines if the model is backdoored. In addition to this feature, we also mitigate these attacks by determining the correct predictions of the poisoned images. An appealing feature of NEO is that it can, for the first time, isolate and reconstruct the backdoor trigger. NEO is also the first defence methodology, to the best of our knowledge that is completely blackbox. We have implemented NEO and evaluated it against three state of the art poisoned models. These models include highly critical applications such as traffic sign detection (USTS) and facial detection. In our evaluation, we show that NEO can detect $\approx$88% of the poisoned inputs on average and it is as fast as 4.4 ms per input image. We also reconstruct the poisoned input for the user to effectively test their systems.
연구 동기 및 목표
- 제3자 MLaaS(기계학습을 서비스로 제공) 환경에서 신뢰성이 저하되는 상황에서 증가하는 백도어 공격의 위협을 해결한다.
- 모델 아키텍처, 가중치, 학습 데이터에 대한 접근이 필요 없는 방어 기법을 개발함으로써 블랙박스 배포를 가능하게 한다.
- 오염된 입력에서 백도어 트리거를 탐지하고 재구성하여 이러한 공격의 은밀한 성격을 드러낸다.
- 트리거를 중화시켜 오염된 입력에 대해 정상적인 예측을 복원하는 완화 전략을 제공한다.
- 모델 가중치나 학습 데이터에 접근할 수 없는 블랙박스 솔루션임에도 불구하고 기존 최신 기법들보다 뛰어난 성능을 발휘한다.
제안 방법
- 입력 이미지의 후보 영역을 체계적으로 마스킹하여 모델 예측의 변화를 관찰함으로써 백도어 트리거의 위치를 특정한다.
- 탐지된 트리거 영역의 주로 색상 정보를 이용해 트리거의 영향력을 중화하는 마스크를 생성한다.
- 예측 변화에 기반해 청소된 입력에 대한 예측 이동을 기준으로 임계값 기반 의사결정 규칙(ΛT)을 적용하여 마스킹된 영역이 백도어 트리거를 나타내는지 판단한다.
- 사용자 투명성과 시스템 개선을 위해 마스킹된 영역에서 원래의 백도어 트리거 패턴을 재구성한다.
- 모델나 학습 과정을 수정하지 않고도 사전 학습된 모든 이미지 분류기와 함께 작동하는 후처리 추론 모듈로 운영된다.
- 청결한 입력의 스트림을 활용해 의심되는 트리거가 오분류를 유도하는지 확인함으로써 다수의 예측 이동을 통해 백도어 존재 여부를 검증한다.
실험 결과
연구 질문
- RQ1모델 아키텍처나 가중치, 학습 데이터에 접근할 수 없는 블랙박스, 모델에 종속되지 않는 접근 방식이 이미지 분류기에서 백도어 트리거를 탐지할 수 있는가?
- RQ2트리거 마스킹 기법은 오염된 입력에 대해 정상 예측을 복원하면서 기존 정확도를 유지하는 데 얼마나 효과적인가?
- RQ3프레임워크는 사용자 검토와 모델 강화를 위해 정확한 백도어 트리거 패턴을 재구성할 수 있는가?
- RQ4NEO의 탐지 및 완화 성능은 기존 최신 화이트박스 방어 기법들과 정확도와 내구성 측면에서 어떻게 비교되는가?
- RQ5NEO는 다양한 최신 백도어 공격 변종에 대해 얼마나 효과적인가?
주요 결과
- NEO는 세 가지 최신 기술 기반 오염된 모델에 대해 평균 88%의 탐지율을 기록하여 강력한 탐지 능력을 입증했다.
- 프레임워크는 평균적으로 각 입력을 4.4ms 내에 처리하여 실시간 배포에 적합한 높은 효율성을 보였다.
- 블랙박스 접근 방식임에도 불구하고, 특히 탐지 정확도 측면에서 기존 화이트박스 방어 기법들을 뛰어넘었다.
- NEO는 정확한 백도어 트리거 패턴을 성공적으로 재구성하여 사용자가 공격의 근본 원인을 검토하고 대응할 수 있도록 했다.
- 청결한 입력에 대한 성능 손실가 최소화되어 기존 정확도를 유지하면서도 악성 행동을 효과적으로 완화했다.
- NEO는 국소적이고 고정된 위치에 있는 트리거를 포함한 다양한 백도어 공격에 효과적이지만, 분산형 트리거에는 대응하지 못한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.