[논문 리뷰] Adversarial Robustness Assessment: Why both $L_0$ and $L_\infty$ Attacks Are Necessary
이 논문은 신경망의 강건성 평가에서 기존 평가 방법의 편향을 해결하기 위해 $L_0$ 및 $L_\infty$ 적대적 공격을 사용하는 모델에 종속되지 않는 이중 강건성 평가 프레임워크를 제안한다. 이는 강건성이 이러한 노름 사이에서 크게 다름을 입증하며, 기존 One-Pixel 공격 대비 12%의 편향만을 요구하면서도 유사한 성공률을 달성하는 새로운 $L_\infty$ 블랙박스 공격을 도입한다.
There exists a vast number of adversarial attacks and defences for machine learning algorithms of various types which makes assessing the robustness of algorithms a daunting task. To make matters worse, there is an intrinsic bias in these adversarial algorithms. Here, we organise the problems faced: a) Model Dependence, b) Insufficient Evaluation, c) False Adversarial Samples, and d) Perturbation Dependent Results). Based on this, we propose a model agnostic dual quality assessment method, together with the concept of robustness levels to tackle them. We validate the dual quality assessment on state-of-the-art neural networks (WideResNet, ResNet, AllConv, DenseNet, NIN, LeNet and CapsNet) as well as adversarial defences for image classification problem. We further show that current networks and defences are vulnerable at all levels of robustness. The proposed robustness assessment reveals that depending on the metric used (i.e., $L_0$ or $L_\infty$), the robustness may vary significantly. Hence, the duality should be taken into account for a correct evaluation. Moreover, a mathematical derivation, as well as a counter-example, suggest that $L_1$ and $L_2$ metrics alone are not sufficient to avoid spurious adversarial samples. Interestingly, the threshold attack of the proposed assessment is a novel $L_\infty$ black-box adversarial method which requires even less perturbation than the One-Pixel Attack (only $12\%$ of One-Pixel Attack's amount of perturbation) to achieve similar results. Code is available at http://bit.ly/DualQualityAssessment.
연구 동기 및 목표
- 기존 공격 및 메트릭의 편향으로 인해 발생하는 적대적 기계학습 분야에서의 모델에 종속되지 않고 종합적인 강건성 평가의 부족을 해결하기 위해.
- 모델 의존성, 평가 부족, 위조된 적대적 샘플, 편향에 의존하는 결과 등 강건성 평가에서 발생하는 문제를 해결하기 위해.
- 높은 품질의 인간이 감지할 수 있는 적대적 샘플을 보장하고 오해의 소지를 피하기 위해 $L_0$ 및 $L_\infty$ 노름을 사용하는 이중 평가 프레임워크를 개발하기 위해.
- 편향의 크기와 관계없이 다양한 수준의 강건성 평가를 효율적이고 확장 가능하게 가능하게 하기 위해 임계값 $th$를 기반으로 한 강건성 수준을 도입하기 위해.
- 최신 네트워크 및 방어 기법에 프레임워크를 검증하여, 어떤 모델도 동시에 $L_0$ 및 $L_\infty$ 공격에 강건하지 않음을 입증하기 위해.
제안 방법
- 모델 의존성을 제거하고 다양한 아키텍처의 평가를 가능하게 하기 위해 모델에 종속되지 않고 기울기 기반이 아닌 블랙박스 공격 프레임워크를 제안하기 위해.
- 모델 기울기나 대상 시스템에 대한 가정에 의존하지 않는 CMA-ES 최적화를 사용하는 새로운 $L_\infty$ 블랙박스 적대적 공격을 도입하기 위해.
- 최대 허용 가능한 편향 크기를 제어하는 임계값 $th$를 통해 강건성 수준을 정의하여 다양한 강건성 척도에서 체계적인 평가를 가능하게 하기 위해.
- 공간 분포 제약 조건을 만족시켜 타당하지 않거나 인식하기 어려운 적대적 샘플을 방지하기 위해 $L_0$ (소수의 픽셀) 및 $L_\infty$ (임계값) 공격을 사용하는 이중 평가를 수행하기 위해.
- 모델 간 정량적 비교를 위해 적대적 정확도 대 임계값 $th$의 곡선 아래 면적(AUC)을 계산하기 위해 트라프레즈 방식을 적용하기 위해.
- 반례 및 수학적 분석을 활용하여 $L_1$ 및 $L_2$ 메트릭만으로는 위조된 적대적 샘플을 방지하는 데 부족함을 입증하기 위해.
실험 결과
연구 질문
- RQ1왜 단일 노름에 의존하기보다 $L_0$ 및 $L_\infty$ 적대적 공격을 동시에 평가해야 하는가?
- RQ2현재 최고 수준의 신경망 및 적대적 방어 기법은 다양한 강건성 수준에서 이중 $L_0$ 및 $L_\infty$ 블랙박스 공격에 어떻게 대응하는가?
- RQ3기존 방법보다 훨씬 낮은 편향을 요구하면서도 높은 성공률을 유지할 수 있는 새로운 $L_\infty$ 블랙박스 공격을 설계할 수 있는가?
- RQ4$L_0$ 및 $L_\infty$ 공격이 동일한 모델에서 유사한 적대적 정확도를 보일 때조차도 서로 다른 취약점을 드러내는 정도는 어느 정도인가?
- RQ5다양한 아키텍처(예: CapsNet, ResNet, LeNet)의 강건성 행동은 강건성 수준을 기반으로 $L_0$ 및 $L_\infty$ 공격에서 어떻게 다름을 보이는가?
주요 결과
- 평가된 모든 신경망 및 방어 기법이 낮은 임계값에서도 $L_0$ 및 $L_\infty$ 공격에 강건하지 않음을 확인하여 광범위한 취약성을 시사한다.
- 제안된 $L_\infty$ 블랙박스 공격는 One-Pixel 공격 대비 12%의 편향만으로도 동일한 적대적 성공률을 달성한다.
- ResNet에서 $th=10$일 때 $L_0$ 및 $L_\infty$ 공격 간 적대적 정확도의 차이는 단지 2%이지만, 테스트 샘플의 17%는 오직 한 가지 노름에 의해서만 공격 가능하다.
- CapsNet은 $L_0$ 공격에 가장 높은 강건성을 보였으며(표 V에서 최고의 AUC), AllConv는 $L_\infty$ 공격에 가장 뛰어난 성능을 보였다.
- $L_0$ 및 $L_\infty$ 공격의 AUC 곡선은 모델 간에 다르게 스케일링되며, CapsNet은 다른 모델들과는 다소 다른 강건성 프로파일을 보였다.
- 이중 평가 프레임워크는 $L_1$ 및 $L_2$ 메트릭만으로는 위조된 적대적 샘플을 방지하는 데 부족함을 입증하였으며, 이는 수학적 유도 및 반례를 통해 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.