Skip to main content
QUICK REVIEW

[논문 리뷰] Regularisation Can Mitigate Poisoning Attacks: A Novel Analysis Based on Multiobjective Bilevel Optimisation

Javier Carnerero-Cano, Luis Muñoz-González|arXiv (Cornell University)|2020. 02. 28.
Adversarial Robustness in Machine Learning참고 문헌 43인용 수 8
한 줄 요약

이 논문은 모델 하이퍼파ram터를 동적으로 조정하는 침투 공격을 모델링하기 위해 새로운 다목적 이중 최적화 프레임워크를 제안한다. 이는 $L_2$ 정규화가 공격 상황에서 정규화 강도를 증가시킴으로써 강건성을 향상시킨다는 것을 드러내며, 이는 이전의 낙관적 가정과는 정반대이다. 이 방법은 하이퍼기울기(Hypergradients)를 계산하기 위해 역방향 미분(reverse-mode differentiation)을 사용하며, $L_2$ 정규화가 모델 파라미터를 안정화시켜 공격의 영향을 완화시킴을 보여준다.

ABSTRACT

Machine Learning (ML) algorithms are vulnerable to poisoning attacks, where a fraction of the training data is manipulated to deliberately degrade the algorithms' performance. Optimal poisoning attacks, which can be formulated as bilevel optimisation problems, help to assess the robustness of learning algorithms in worst-case scenarios. However, current attacks against algorithms with hyperparameters typically assume that these hyperparameters remain constant ignoring the effect the attack has on them. We show that this approach leads to an overly pessimistic view of the robustness of the algorithms. We propose a novel optimal attack formulation that considers the effect of the attack on the hyperparameters by modelling the attack as a multiobjective bilevel optimisation problem. We apply this novel attack formulation to ML classifiers using $L_2$ regularisation and show that, in contrast to results previously reported, $L_2$ regularisation enhances the stability of the learning algorithms and helps to mitigate the attacks. Our empirical evaluation on different datasets confirms the limitations of previous strategies, evidences the benefits of using $L_2$ regularisation to dampen the effect of poisoning attacks and shows how the regularisation hyperparameter increases with the fraction of poisoning points.

연구 동기 및 목표

  • 공격 강도에 관계없이 고정된 하이퍼파ram터를 가정하는 이전 침투 공격 연구의 한계를 해결하기 위해.
  • 악성 데이터에 의해 유도되는 하이퍼파라미터 이동을 고려하여, 침투 공격과 하이퍼파라미터 적응 간의 상호작용을 최악의 시나리오에서 모델링하기 위해.
  • 침투 공격 중 하이퍼파라미터가 적응할 수 있도록 허용할 경우 $L_2$ 정규화가 침투 공격을 완화할 수 있는지 조사하기 위해.
  • 악성 데이터에 의해 유도되는 하이퍼파라미터 이동을 고려함으로써 모델 강건성에 대한 더 정확한 평가를 제공하기 위해.
  • $L_2$ 정규화가 공격 상황에서 안정화 메커니즘으로 작용하며, 공격 강도가 증가함에 따라 정규화 강도를 증가시킨다는 것을 보여주기 위해.

제안 방법

  • 침투 공격를 다목적 이중 최적화 문제로 공식화하며, 외부 목표는 침투 점과 모델 하이퍼파라미터를 동시에 최적화하고, 내부 목표는 모델 파라미터를 학습한다.
  • 최악의 시나리오를 최소화-최대화 문제(minimax problem)로 모델링하며, 공격자는 테스트 오차를 최대화하고, 방어자는 침투된 데이터에 대한 손실을 최소화한다.
  • 침투 점과 정규화 하이퍼파라미터에 대한 하이퍼기울기를 효율적으로 근사하기 위해 역방향 미분(RMD)을 사용한다.
  • 공격과 하이퍼파라미터 적응을 유연한 엔드 투 엔드 방식으로 동시에 최적화하기 위해 하이퍼기울기 경사하강/상승을 적용한다.
  • 다양한 침투 비율을 가진 ImageNet 및 기타 데이터셋을 사용하여 로지스틱 회귀와 딥 네URAL 네트워크(DNNs)에서 프레임워크를 평가한다.
  • 정규화 하이퍼파라미터가 고정되어 있는지, 공격 중에 엔드 투 엔드로 학습되는지의 상황을 비교한다.

실험 결과

연구 질문

  • RQ1이전의 침투 공격 연구에서 하이퍼파라미터를 고정한다고 가정함으로써 모델 강건성에 대한 평가가 지나치게 낙관적으로 이뤄지는 이유는 무엇인가?
  • RQ2정규화 하이퍼파라미터가 공격 중에 적응할 수 있도록 허용할 경우, $L_2$ 정규화가 침투 공격을 어느 정도 완화할 수 있는가?
  • RQ3공격 강도가 증가함에 따라 $L_2$ 정규화 하이퍼파라미터의 값은 어떻게 변화하는가?
  • RQ4침투 공격 하에서 모델 파라미터의 크기(예: $||\mathbf{w}_{\text{layer}}||_2^2$)와 레이어의 취약성 간의 관계는 무엇인가?
  • RQ5정규화 하이퍼파라미터를 엔드 투 엔드로 학습할 경우, 청소된 데이터에서의 모델 정확도와 침투 공격 하에서의 강건성 사이의 상충 관계는 어떻게 되는가?

주요 결과

  • 이전의 연구들 [38]과는 달리, $L_2$ 정규화는 침투 공격에 대한 취약성을 증가시키지 않으며, 오히려 모델 안정성을 향상시키고 공격의 영향을 완화시킨다.
  • 침투 점의 비율이 증가할수록 $L_2$ 정규화 하이퍼파라미터가 증가함을 확인하여, 모델이 공격에 의한 불안정성에 저항하기 위해 자가 적응적으로 정규화 강도를 높인다는 것을 시사한다.
  • ImageNet에 적용된 DNN에서 $λ = -8$ 이며 16.6%의 침투 점이 삽입된 경우 테스트 오차가 12%로 상승했지만, $λ = \log(40)$ 일 경우 안정적으로 유지되었고, 엔드 투 엔드 하이퍼파라미터 학습($λ_{\text{RMD}}$) 시에도 상대적으로 미약하게 증가하였다.
  • 학습된 정규화 하이퍼파라미터가 가장 빠르게 증가한 부분은 두 번째 및 출력 레이어였으며, 이는 깊이 있는 레이어가 침투에 더 취약하다는 것을 시사한다.
  • 고정된 정규화 조건에서는 침투 공격 시 마지막 두 레이어의 $L_2$ 노름이 크게 감소했지만, $λ$가 학습된 경우 더 안정적으로 유지되었다.
  • 공격이 존재하지 않을 경우, $λ_{\text{RMD}}$는 고정된 $λ$ 값보다 낮은 테스트 오차를 기록하여, 청소된 환경에서도 엔드 투 엔드 하이퍼파라미터 학습이 성능을 향상시킨다는 것을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.