[논문 리뷰] Neural Networks with Structural Resistance to Adversarial Attacks
이 논문은 ℓ∞ 노름과 개별 입력 스케일링을 사용하는 라디얼 기저 함수 유닛(RBFI 유닛)을 도입하여, 적대적 공격에 내재된 저항성을 갖춘 신경망을 제안한다. 표준 기울기로는 매우 비선형이며 학습이 어려운 RBFI 네트워크는, 표준 데이터로만 훈련된 상태에서 강력한 PGD 공격 조건에서도 90% 이상의 정확도를 유지하며, ReLU 및 시그모이드 네트워크는 이 조건에서 2% 미만으로 급격히 떨어진다.
In adversarial attacks to machine-learning classifiers, small perturbations are added to input that is correctly classified. The perturbations yield adversarial examples, which are virtually indistinguishable from the unperturbed input, and yet are misclassified. In standard neural networks used for deep learning, attackers can craft adversarial examples from most input to cause a misclassification of their choice. We introduce a new type of network units, called RBFI units, whose non-linear structure makes them inherently resistant to adversarial attacks. On permutation-invariant MNIST, in absence of adversarial attacks, networks using RBFI units match the performance of networks using sigmoid units, and are slightly below the accuracy of networks with ReLU units. When subjected to adversarial attacks, networks with RBFI units retain accuracies above 90% for attacks that degrade the accuracy of networks with ReLU or sigmoid units to below 2%. RBFI networks trained with regular input are superior in their resistance to adversarial attacks even to ReLU and sigmoid networks trained with the help of adversarial examples. The non-linear structure of RBFI units makes them difficult to train using standard gradient descent. We show that networks of RBFI units can be efficiently trained to high accuracies using pseudogradients, computed using functions especially crafted to facilitate learning instead of their true derivatives. We show that the use of pseudogradients makes training deep RBFI networks practical, and we compare several structural alternatives of RBFI networks for their accuracy.
연구 동기 및 목표
- 표준 활성화 함수의 局소 선형성으로 인해 발생하는 딥 신경망의 근본적 취약성, 즉 적대적 예외에 대한 취약성을 해결하기 위해.
- 적대적 훈련이나 복잡한 정규화에 의존하지 않고도 내재적으로 적대적 공격에 강건한 신경망 아키텍처를 개발하기 위해.
- 비가역성 성분(예: 최대값 연산자 및 가우시안 함수 내 지수함수)의 기울기를 인위적으로 정의한 허구 기울기(pseudogradients)를 사용하여, 비가역성 성분을 가진 고도로 비선형인 네트워크를 효과적으로 학습시키는 데 목적이 있다.
- RBFI 기반 네트워크의 적대적 공격에 대한 강건성과 정확도를 평가하며, 특히 ReLU 및 시그모이드 네트워크와의 비교를 포함한다.
- 특히 ℓ∞-노름 기반 RBF 유닛을 통한 구조적 비선형성이, 적대적 조건 하에서 정확도와 강건성 측면에서 표준 아키텍처를 능가할 수 있는지 탐색한다.
제안 방법
- 라디얼 기저 함수에서 유도된 새로운 네트워크 유닛 유형인 RBFI 유닛을 제안하며, 다중 입력 선형성을 깨뜨리기 위해 ℓ∞ 노름과 개별 입력 스케일링을 사용한다.
- 비가역성 성분(예: 최대값 연산자 및 가우시안 함수 내 지수함수)에 대해 허구 기울기(인위적으로 정의된 도함수)를 사용하여, 비연속성 유닛에서도 역전파를 가능하게 한다.
- 제곱 오차 손실과 AdaDelta 최적화를 사용한 수정된 손실 함수를 도입하여, 깊은 RBFI 네트워크를 효과적으로 훈련시킨다.
- 고 u-경계 RBFI 네트워크의 강건성을 향상시키기 위해 하이퍼파ram터 $ c $ 를 사용한 정규화 체계를 도입한다.
- 적대적 훈련을 포함한 다양한 아키텍처와 훈련 방식에서 RBFI 네트워크를 ReLU 및 시그모이드 네트워크와 비교한다.
- 방정정식 (7)과 (8)에서 유도된 민감도 경계를 사용하여 이론적 강건성을 분석하지만, 실제 결과보다 예측 능력이 떨어지는 것으로 나타났다.
실험 결과
연구 질문
- RQ1적대적 훈련 없이도 내재된 비선형성으로 인해 적대적 공격에 저항할 수 있는 신경망 아키텍처를 설계할 수 있는가?
- RQ2라디얼 기저 함수에 ℓ∞ 노름을 사용할 경우, 표준 ℓ2 기반 RBF 또는 ReLU/시그모이드 유닛과 비교해 적대적 강건성에 어떤 영향을 미치는가?
- RQ3허구 기울기는 비가역성 활성화 성분을 가진 깊은 네트워크의 효과적인 학습을 어느 정도 가능하게 하는가?
- RQ4RBFI 유닛을 통한 구조적 저항성이, 새로운 공격에 대한 일반화 능력 측면에서 적대적 훈련보다 뛰어나다고 볼 수 있는가?
- RQ5깊이, 너비, 정규화와 같은 아키텍처 선택이 RBFI 네트워크의 강건성과 정확도에 어떤 영향을 미치는가?
주요 결과
- PGD 공격에서 ℓ∞-경계 3 조건 하에서도 RBFI 네트워크는 테스트 정확도를 90% 이상 유지하는 반면, ReLU 및 시그모이드 네트워크는 동일 조건에서 2% 미만으로 급격히 떨어진다.
- 표준 데이터로만 훈련된 상태에서도 RBFI 네트워크는 적대적 미세조정을 거친 ReLU 및 시그모이드 네트워크를 능가하며, 이는 구조적 강건성을 입증한다.
- 128-128-128-128-128-10 RBFI 네트워크는 20 에포크 후 95.53%의 정확도를 달성했고, 유사한 구조의 시그모이드 네트워크는 효과적으로 학습되지 않아 단지 11.24%의 정확도를 기록했다.
- c = 0.0001 으로 정규화한 결과, 고 u-경계 RBFI 네트워크의 민감도 경계는 1,072.90에서 231.90으로 감소하여 강건성이 향상되었고, 정확도 손실은 거의 없었다.
- 방정식 (7)과 (8)을 통해 계산된 민감도 경계는 실제 강건성 예측에 빈약한 것으로 나타났다. 예를 들어, 높은 민감도 경계를 가진 ReLU 네트워크도 단순한 FGSM 공격에서 실패했다.
- RBF 유닛의 더 규칙적인 노름 구조에도 불구하고, RBFI 유닛은 훈련 안정성과 강건성 측면에서 표준 RBF 유닛을 능가한다. 이는 ℓ∞ 기반 비선형성이 적대적 저항성에 더 효과적임을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.