[논문 리뷰] Drawing Robust Scratch Tickets: Subnetworks with Inborn Robustness Are Found within Randomly Initialized Networks
이 논문은 훈련 없이 무작위로 초기화된 깊은 신경망 내부에 내재된 강건성(강건성 스크래치 티켓, RST)을 지닌 서브넷워크가 존재한다는 것을 발견한다. 이러한 RST는 적대적 훈련된 모델의 강건성 정확도와 동일하거나 이를 초월하며, 랜덤 RST 스위치(R2S) 기법을 통해 RST 간 동적 전환을 통해 강건성을 추가로 향상시켜, 파라미터 효율적인 방어 전략을 제공한다.
Deep Neural Networks (DNNs) are known to be vulnerable to adversarial attacks, i.e., an imperceptible perturbation to the input can mislead DNNs trained on clean images into making erroneous predictions. To tackle this, adversarial training is currently the most effective defense method, by augmenting the training set with adversarial samples generated on the fly. Interestingly, we discover for the first time that there exist subnetworks with inborn robustness, matching or surpassing the robust accuracy of the adversarially trained networks with comparable model sizes, within randomly initialized networks without any model training, indicating that adversarial training on model weights is not indispensable towards adversarial robustness. We name such subnetworks Robust Scratch Tickets (RSTs), which are also by nature efficient. Distinct from the popular lottery ticket hypothesis, neither the original dense networks nor the identified RSTs need to be trained. To validate and understand this fascinating finding, we further conduct extensive experiments to study the existence and properties of RSTs under different models, datasets, sparsity patterns, and attacks, drawing insights regarding the relationship between DNNs' robustness and their initialization/overparameterization. Furthermore, we identify the poor adversarial transferability between RSTs of different sparsity ratios drawn from the same randomly initialized dense network, and propose a Random RST Switch (R2S) technique, which randomly switches between different RSTs, as a novel defense method built on top of RSTs. We believe our findings about RSTs have opened up a new perspective to study model robustness and extend the lottery ticket hypothesis.
연구 동기 및 목표
- 훈련 없이도 무작위로 초기화된 깊은 신경망 내에 강건한 서브넷워크가 존재하는지 조사하기.
- 모델 초기화, 과다 매개변수화와 DNN 내 내재된 강건성 간의 관계를 이해하기.
- 훈련되지 않은 모델 내에서 발견된 서브넷워크의 내재된 강건성을 활용한 실용적인 방어 기법 개발하기.
- 다양한 데이터셋과 희박성 수준 간에 강건한 서브넷워크의 이동성과 효율성 탐색하기.
- RST 간 동적 전환을 통해 강건성을 향상시키는 새로운 방어 기법인 랜덤 RST 스위치(R2S) 제안하기.
제안 방법
- 훈련 없이도 무작위로 초기화된 밀집 네트워크에서 크기 기반 프루닝을 통해 서브넷워크(RST) 식별하기.
- 여러 데이터셋과 아키텍처에서 표준 적대적 공격(PGD, Auto-Attack 등)을 사용해 RST의 강건성 평가하기.
- 추론 중에 다수의 RST 간 랜덤 전환을 통해 강건성을 향상시키는 랜덤 RST 스위치(R2S) 기법 제안하기.
- 적응형 공격(예: 전환에 대한 기대값, 앙상블 기반 공격)에 대비해 R2S의 강건성 평가하기.
- 적대적 훈련된 서브넷워크(적대적 RTT)와 RST를 비교하여 이동성 및 파라미터 효율성 평가하기.
- 모델, 데이터셋, 희박성 패턴, 공격 유형을 다양하게 변화시켜 RST의 일관성과 특성 검증을 위한 광범위한 분석 수행하기.
실험 결과
연구 질문
- RQ1훈련 없이도 무작위로 초기화된 깊은 신경망 내부에 내재된 강건성 특성을 지닌 서브넷워크가 존재하는가?
- RQ2유사한 모델 크기를 가진 적대적 훈련된 모델과 비교했을 때 RST의 강건성은 어떻게 되는가?
- RQ3네트워크 초기화, 과다 매개변수화와 강건한 서브넷워크의 출현 간의 관계는 무엇인가?
- RQ4다양한 희박성 비율과 데이터셋 간에 RST는 얼마나 이동 가능하며, 이는 강건성에 영향을 미치는가?
- RQ5RST 간 동적 전환은 정적 모델 대비 적대적 강건성을 크게 향상시킬 수 있는가?
주요 결과
- 무작위로 초기화된 ResNet101에서 도출된 RST는 ε=2 및 ε=4일 때 각각 3.56%, 4.31% 높은 강건성 정확도를 보이며, 적대적 훈련된 ResNet18을 초월한다.
- CIFAR-10에서 PGD-20 공격 조건에서 R2S는 적대적 훈련된 모델 대비 13.74%에서 15.28% 높은 강건성 정확도를 기록한다.
- 적응형 공격(EOT 및 앙상블 기반 공격) 조건에서도 R2S는 적대적 훈련된 모델 대비 7.40%에서 9.83% 높은 강건성 정확도를 유지한다.
- RST는 다양한 희박성 비율 간에 열악한 적대적 이동성을 보이며, 이는 효과적인 R2S 방어 설계를 가능하게 한다.
- CIFAR-100에서 RST는 이동된 적대적 RTT보다 강건성 정확도에서 1.68% 높게 성능을 내어, 뛰어난 파라미터 효율성과 강건성을 입증한다.
- 동일한 무작위로 초기화된 밀집 네트워크를 여러 작업의 공통 백본으로 사용할 수 있으며, 이는 이진 마스크를 통해 작업별 RST를 압축하여 효율적인 구현을 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.