Skip to main content
QUICK REVIEW

[논문 리뷰] Mind the box: $l_1$-APGD for sparse adversarial attacks on image classifiers

Francesco Croce, Matthias Hein|arXiv (Cornell University)|2021. 03. 01.
Adversarial Robustness in Machine Learning인용 수 7
한 줄 요약

이 논문은 기존의 $l_1$-PGD 방법들이 간과한 $l_1$-볼과 이미지 도메인 $[0,1]^d$의 교차 부분에 정확하게 투영하는 방식을 적용한 새로운 적대적 공격 방법인 $l_1$-APGD를 제안한다. 이는 이미지 분류기에서 희소 적대적 공격의 성능을 향상시킨다. 본 방법은 적대적 훈련에서 최고 수준의 $l_1$-로버스트성을 달성하며, 최소한의 계산 부담으로도 $l_1$-로버스트성 평가에 있어 뛰어난 성능을 보이는 신뢰할 수 있는 앙상블 공격인 $l_1$-AutoAttack를 가능하게 한다.

ABSTRACT

We show that when taking into account also the image domain $[0,1]^d$, established $l_1$-projected gradient descent (PGD) attacks are suboptimal as they do not consider that the effective threat model is the intersection of the $l_1$-ball and $[0,1]^d$. We study the expected sparsity of the steepest descent step for this effective threat model and show that the exact projection onto this set is computationally feasible and yields better performance. Moreover, we propose an adaptive form of PGD which is highly effective even with a small budget of iterations. Our resulting $l_1$-APGD is a strong white-box attack showing that prior works overestimated their $l_1$-robustness. Using $l_1$-APGD for adversarial training we get a robust classifier with SOTA $l_1$-robustness. Finally, we combine $l_1$-APGD and an adaptation of the Square Attack to $l_1$ into $l_1$-AutoAttack, an ensemble of attacks which reliably assesses adversarial robustness for the threat model of $l_1$-ball intersected with $[0,1]^d$.

연구 동기 및 목표

  • 기존의 $l_1$-PGD 공격가 이미지 도메인 제약 조건 $[0,1]^d$를 간과함으로써 최적화되지 않는 문제를 해결하기 위해.
  • 계산적으로 실현 가능한 정확한 투영 연산자 $P_S(u)$를 $l_1$-볼과 $[0,1]^d$의 교차 부분에 대해 제안하여, 이는 근사 투영보다 더 정확하고 강력한 공격 성능을 제공함을 보여준다.
  • 사용자 입력 없이도 동적으로 스텝 크기를 선택하는 완전히 적응형 PGD 변형인 $l_1$-APGD를 개발하여, 수동적인 스텝 크기 조정 없이도 공격 성능과 수렴성을 향상시킨다.
  • $l_1$-APGD, 타겟된 $l_1$-FAB, $l_1$-Square Attack를 조합한 앙상블인 $l_1$-AutoAttack를 구성하여, $l_1$-로버스트성 평가의 신뢰성과 효과성을 확보한다.

제안 방법

  • 집합 $S = B_1(x, \nabla L(x^{(i)})) \cap [0,1]^d$에 대한 정확한 투영 연산자 $P_S(u)$를 제안하며, 이는 계산적으로 실현 가능하고 근사 투영보다 더 정확하다.
  • 제약 조건이 있는 위협 모델 $S$에 대해 올바른 기울기 하강 방향을 유도하여, 더 효과적인 편향 업데이트를 가능하게 한다.
  • $l_1$-APGD를 도입하며, 사용자 입력 없이도 동적으로 스텝 크기를 선택하는 완전히 적응형 PGD 변형으로, 로버스트성과 수렴성을 향상시킨다.
  • Square Attack를 $l_1$-노름에 맞게 변형하고, $l_1$-AutoAttack에 통합하여 다양한 공격 유형을 조합함으로써 종합적인 로버스트성 평가를 가능하게 한다.
  • 다양한 랜덤 리스타트를 활용한 다단계 공격 전략을 채택하며, 교차 엔트로피 손실과 타겟된 DLR 손실을 함께 사용하여 성공률을 향상시킨다.

실험 결과

연구 질문

  • RQ1표준 $l_1$-PGD 공격는 $l_1$-편향을 위해 설계되었음에도 불구하고, 이미지 분류에서 왜 최적의 성능을 내지 못하는가?
  • RQ2$l_1$-볼과 $[0,1]^d$의 교차 부분에 대한 정확한 투영은 효율적으로 계산할 수 있으며, 이는 더 강력한 적대적 공격를 유도하는가?
  • RQ3고정된 스텝 크기를 사용하는 PGD와 비교해, 적응형이자 파rameter-free인 PGD 체계는 공격 성능과 로버스트성 평가에 있어 향상되는가?
  • RQ4$l_1$-APGD는 다른 공격들과 효과적으로 조합되어, 예를 들어 $l_1$-AutoAttack와 같이 신뢰할 수 있는 앙상블을 구성할 수 있는가? 이는 $l_1$-로버스트성 평가에 기여하는가?
  • RQ5적대적 훈련에 $l_1$-APGD를 적용하면 최고 수준의 $l_1$-로버스트 정확도를 달성하는 모델을 얻을 수 있는가?

주요 결과

  • 집합 $S = B_1(x,\epsilon) \cap [0,1]^d$에 대한 정확한 투영은 계산적으로 실현 가능하며, 근사 투영 대비 공격 성능을 크게 향상시킨다.
  • CIFAR-100 ($\epsilon=12$)에서 $l_1$-APGD는 표준 PGD 및 다른 기준 대비 최고의 $l_1$-로버스트 정확도를 달성한다.
  • ImageNet ($\epsilon=60$)에서 $l_1$-APGD는 $l_2$-로버스트 모델에 대해 40.5%의 로버스트 정확도를 기록했으며, $l_\infty$-로버스트 모델에 대해서는 4.4%의 정확도를 기록하여 다른 공격들과 비교해도 뒤지지 않는다.
  • $l_1$-AutoAttack는 ImageNet과 CIFAR-100에서 4개의 경우 중 2개에서 가장 낮은 로버스트 정확도를 기록하여, 모델의 로버스트성을 신뢰성 있게 추정함을 시사한다.
  • $l_1$-APGD는 B&B보다 훨씬 빠르며, 1000장의 이미지에 대해 100단계로 254초가 소요되는 데 반해, B&B는 3612초가 소요된다.
  • $l_1$-AutoAttack 앙상블은 일괄적인 공격들보다 항상 뛰어난 성능을 보이며, $l_1$-로버스트성 평가에 대해 신뢰할 수 있는 기준이 된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.