[논문 리뷰] Playing the Game of Universal Adversarial Perturbations
이 논문은 분류기와 적대자 간의 상호작용을 이인자 제로섬 게임으로 모델링하여, 일반적인 적대적 편향에 대한 강건한 이미지 분류기 학습을 위한 게임 이론적 접근을 제안한다. 허구적 플레이의 확장 버전을 사용하여 이전에 생성된 일반적인 편향을 점진적으로 통합함으로써 강건성을 향상시키며, CIFAR10, CIFAR100, ImageNet에서 표준 적대적 훈련을 능가한다. 특히 일반적인 편향과 적대적 패치에 대해 뛰어난 성능을 보인다.
We study the problem of learning classifiers robust to universal adversarial perturbations. While prior work approaches this problem via robust optimization, adversarial training, or input transformation, we instead phrase it as a two-player zero-sum game. In this new formulation, both players simultaneously play the same game, where one player chooses a classifier that minimizes a classification loss whilst the other player creates an adversarial perturbation that increases the same loss when applied to every sample in the training set. By observing that performing a classification (respectively creating adversarial samples) is the best response to the other player, we propose a novel extension of a game-theoretic algorithm, namely fictitious play, to the domain of training robust classifiers. Finally, we empirically show the robustness and versatility of our approach in two defence scenarios where universal attacks are performed on several image classification datasets -- CIFAR10, CIFAR100 and ImageNet.
연구 동기 및 목표
- 실세계 응용에서 이식 가능하고 현실적인 위협인 일반적인 적대적 편향에 대비한 강건한 방어 메커니즘이 부족한 문제를 해결한다.
- 특히 큰 편향 크기에서 일반적인 적대적 훈련이 일반화에 실패하는 점을 극복한다.
- 높은 표준 정확도를 유지하면서도 일반적인 편향과 적대적 패치 양쪽에 대해 강력한 강건성을 확보하는 확장 가능한 방어 프레임워크를 개발한다.
- 공간적으로 국한된 적대적 패치를 특별히 다룰 수 있도록 설계된 첫 번째 방어 메커니즘을 제공한다. 이는 이전 문헌에서 다루지 않은 위협 유형이다.
- ImageNet과 같은 대규모 데이터셋에 대해 이 방법의 확장성을 입증한다. 이는 이전의 강건한 훈련 방법이 계산 비용으로 인해 어려움을 겪었던 분야이다.
제안 방법
- 분류기(분류 손실 최소화)와 적대자(일반적인 편향를 통해 동일한 손실 최대화) 사이의 이인자 제로섬 게임으로 적대적 강건성 훈련을 수립한다.
- 딥 러닝 환경에 맞게 허구적 플레이 알고리즘을 확장하여, 양 측면이 상대방의 이전 최적 반응을 기반으로 전략을 업데이트한다.
- 각 훈련 단계에서 분류기는 청소년 데이터와 이전에 생성된 일반적인 편향의 조합으로 훈련되며, 동시에 적대자는 현재 분류기의 오분류를 최대화하기 위해 새로운 편향을 생성한다.
- 반복 최적화를 사용하여 고정된 L∞-노름 제약 조건을 갖는 일반적인 편향을 생성함으로써, 데이터셋 내 모든 이미지에 효과적으로 작용하도록 보장한다.
- 일반적인 편향(전체 이미지에 적용)과 일반적인 적대적 패치(랜덤 위치에 적용되는 국소적 원형 패치) 양쪽에 모두 이 방법을 적용한다.
- 확률적 경사 하강법과 효율적인 편향 생성을 통해 훈련 과정을 스케일링하여, 높은 계산 요구량에도 불구하고 ImageNet에의 구현을 가능하게 한다.
실험 결과
연구 질문
- RQ1허구적 플레이 기반의 게임 이론적 프레임워크는 표준 적대적 훈련에 비해 일반적인 적대적 편향에 대해 강건성을 향상시킬 수 있는가?
- RQ2표준 적대적 훈련이 실패하는 상황, 특히 큰 일반적인 편향 크기에서, 제안된 방법이 높은 표준 정확도를 유지하면서도 강력한 강건성을 확보할 수 있는가?
- RQ3이 방법은 이전에 다루지 않은 위협으로 간주되었던 공간적으로 국한된 적대적 패치에 대비하여 확장 가능할 수 있는가?
- RQ4이전의 강건한 훈련 접근 방식이 계산 비용으로 인해 어려움을 겪었던 대규모 데이터셋인 ImageNet에 대해 이 방법은 어떻게 확장 가능한가?
- RQ5표준 적대적 훈련이 가장 최근의 편향에만 의존하는 것과 달리, 허구적 플레이를 통해 이전에 생성된 편향을 통합하는 것이 더 효과적인가?
주요 결과
- 16픽셀의 일반적인 편향을 가진 CIFAR10에서, 허구적 플레이 방법은 표준 적대적 훈련(20% 미만)과 SGD(약 60%)에 비해 훨씬 높은 강건 정확도(70% 이상)를 달성하여 뛰어난 강건성을 입증했다.
- 8픽셀의 편향을 가진 CIFAR100에서, 허구적 플레이 방법은 표준 정확도에 가까운 적대적 정확도(80% 이상)를 유지하며, SGD와 적대적 훈련을 모두 능가했다.
- CIFAR100과 ImageNet에서 적대적 패치에 대해 최신 기술 수준의 강건성을 확보했으며, 이 특정 공격 유형에 대해 이전에 방어 메커니즘이 존재하지 않았다.
- ImageNet에서, 이 방법은 대규모 데이터에 대해 성공적으로 확장되었으며, 일반적인 편향과 적대적 패치에 모두 대해 강건성이 향상되었고, 높은 표준 정확도를 유지했다.
- 특히 큰 편향 예산을 적용한 경우에도, 표준 적대적 훈련에 비해 일반적인 편향에 대한 강건성에서 뛰어난 성능을 보였다.
- 결과적으로, 허구적 플레이를 통해 이전의 편향을 통합하는 접근 방식이, 가장 최근의 편향에만 의존하는 방법보다 더 안정적이고 일반화 가능한 강건성을 제공한다는 점이 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.