[논문 리뷰] Backdoor Attack and Defense for Deep Regression
이 논문은 입력 공간 내 국소화된 공격 샘플을 통해 타겟된 백도어 공격을 제안하며, 이를 감지하는 것을 피하기 위해 데이터 풀링을 사용한다. 또한 기울기 기반 국소 오차 최대화 기법을 활용해 오염된 샘플을 식별하고 제거하는 방어 기법을 도입하여 금융 파생상품 가격 산정 과제에서 공격 오차를 50% 감소시키면서도 높은 테스트 정확도를 유지한다.
We demonstrate a backdoor attack on a deep neural network used for regression. The backdoor attack is localized based on training-set data poisoning wherein the mislabeled samples are surrounded by correctly labeled ones. We demonstrate how such localization is necessary for attack success. We also study the performance of a backdoor defense using gradient-based discovery of local error maximizers. Local error maximizers which are associated with significant (interpolation) error, and are proximal to many training samples, are suspicious. This method is also used to accurately train for deep regression in the first place by active (deep) learning leveraging an "oracle" capable of providing real-valued supervision (a regression target) for samples. Such oracles, including traditional numerical solvers of PDEs or SDEs using finite difference or Monte Carlo approximations, are far more computationally costly compared to deep regression.
연구 동기 및 목표
- 학습 데이터셋에서 타겟된 데이터 오염을 통해 딥 레그리션 모델에 새로운 백도어 공격을 제안하는 것.
- 정상 데이터 주변에 오염된 샘플을 국소화하는 것이 공격 성공에 필수적임을 보여주는 것.
- 기울기 기반 국소 오차 최대화 기법을 활용해 백도어 공격를 탐지하고 완화하는 방어 기법을 개발하는 것.
- 비싼 오라클을 사용해 훈련된 딥 네트워크를 활용해 실제 금융 파생상품 가격 산정 과제에서 방법을 평가하는 것.
- 의심스러운 국소 오차 최대화 기법 주변의 샘플을 제거함으로써 공격 성능을 크게 감소시키면서도 정상 추론 정확도를 떨어뜨리지 않는 것.
제안 방법
- 공격는 입력 공간의 특정 지역(만기까지의 시간, 변동성, 이자율에 대한 제약 조건을 포함)에 국소화된 트리거 패턴을 가진 잘못 레이블링된 훈련 샘플을 삽입한다.
- 방어는 딥 네트워크와 오라클 간 오차의 국소 최대화를 위해 기울기 상승 기법을 사용하며, 고도의 내삽 오차가 있는 영역에 집중한다.
- 국소 오차 최대화 기법은 정상적인 훈련 샘플들에 가까운(유클리드 거리 < 0.1 이내) 고오차를 보일 경우 의심스럽게 표시된다.
- 이 방법은 활성 학습 원리를 활용하며, 오라클을 사용해 의심스러운 샘플을 제거한 후 모델을 재학습시킨다.
- 재학습은 가중치 MSE 목표 함수를 사용하며, 청소된 데이터에는 높은 가중치(α = 0.99)를, 탐지된 악성 샘플에는 낮은 가중치를 적용한다.
- 훈련 샘플의 근접도 대신 밀도 모델(예: 가우시안 믹스처)을 사용함으로써 근접도 하이퍼파rameter를 제거함으로써 방어 기법을 향상시킬 수 있다.
실험 결과
연구 질문
- RQ1국소화된 데이터 오염을 통해 딥 레그리션 모델에 백도어를 성공적으로 심을 수 있는가?
- RQ2왜 오염된 샘플의 국소화가 이러한 공격의 성공에 필수적인가?
- RQ3기울기 기반 국소 오차 최대화 기법이 딥 레그리션 모델에서 백도어 트리거를 신뢰성 있게 탐지할 수 있는가?
- RQ4의심스러운 국소 오차 최대화 기법 주변의 샘플을 제거하는 것이 공격 성능을 효과적으로 저감시키면서도 정상 모델 정확도를 떨어뜨리지 않는가?
- RQ5실제 금융 파생상품 가격 산정 시나리오에서 기준 모델 대비 이 방어 기법의 성능은 어떠한가?
주요 결과
- 방어 재학습 후 원래 오염된 모델 대비 공격 MSE가 50% 감소하였다.
- 방어는 공격 MSE를 약 50% 감소시켰으며, 청소된 데이터에 대한 테스트 MSE와 테스트 MAE는 유지되거나 약간 향상되었다.
- 백도어 영역 내 6개의 국소 오차 최대화 기법 각각이 1,000개 이상의 근접한 훈련 샘플을 보유하고 있었으며, 오차에서는 98.5 percentile, 근접도에서는 99.9 percentile에 해당했다.
- 근접한 훈련 샘플의 거짓 양성률은 낮았으며(0.012%), 오염 영역을 정확하게 식별하는 데 높은 특이도를 보였다.
- 방어 기법은 백도어 영역에서 1,823개의 잘못 레이블링된 샘플을 성공적으로 제거하면서도 청소된 데이터에 대한 모델 성능을 유지했다.
- 원시 훈련 샘플의 근접도 대신 밀도 모델을 사용할 경우에도 이 방법은 효과적이며, 하이퍼파rameter에 대한 의존도를 감소시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.