[논문 리뷰] Second-Order Provable Defenses against Adversarial Attacks
이 논문은 $\ell_2$-bounded 적대적 공격에 대한 효율적이고 날카운 감도 인증을 위해 두 번째 차수 정보(헤시안 고유값 범위)를 활용하는 곡률 기반 안정성 인증(CRC)과 곡률 기반 안정성 훈련(CRT)을 제안한다. 훈련 중에 네트워크의 곡률을 정규화함으로써 CRT는 상태 기반의 인증된 안정성 정확도를 달성한다—2-, 3-, 4층 MNIST 네트워크에서 각각 69.79%, 57.78%, 53.19%로, 기존의 IBP 기반 방법보다 뚜렷이 뛰어나다.
A robustness certificate is the minimum distance of a given input to the decision boundary of the classifier (or its lower bound). For {\it any} input perturbations with a magnitude smaller than the certificate value, the classification output will provably remain unchanged. Exactly computing the robustness certificates for neural networks is difficult since it requires solving a non-convex optimization. In this paper, we provide computationally-efficient robustness certificates for neural networks with differentiable activation functions in two steps. First, we show that if the eigenvalues of the Hessian of the network are bounded, we can compute a robustness certificate in the $l_2$ norm efficiently using convex optimization. Second, we derive a computationally-efficient differentiable upper bound on the curvature of a deep network. We also use the curvature bound as a regularization term during the training of the network to boost its certified robustness. Putting these results together leads to our proposed {\bf C}urvature-based {\bf R}obustness {\bf C}ertificate (CRC) and {\bf C}urvature-based {\bf R}obust {\bf T}raining (CRT). Our numerical results show that CRT leads to significantly higher certified robust accuracy compared to interval-bound propagation (IBP) based training. We achieve certified robust accuracy 69.79\%, 57.78\% and 53.19\% while IBP-based methods achieve 44.96\%, 44.74\% and 44.66\% on 2,3 and 4 layer networks respectively on the MNIST-dataset.
연구 동기 및 목표
- 일阶 리프시츠 경계가 아닌 두 번째 차수 정보(곡률)를 사용하여 $\ell_2$-bounded 적대적 공격에 대해 증명 가능하게 안정적인 방어 기법을 개발한다.
- 네트워크의 헤시안 행렬 고유값에 대한 경계를 이용해 효율적이고 날카운 감도 인증을 계산한다.
- 훈련 중에 네트워크 곡률을 줄이는, 미분 가능한 곡률 기반 정규화 항을 설계한다.
- 곡률 정규화가 존재하는 간격 경계 전파(IBP) 방법보다 훨씬 높은 인증된 안정성 정확도를 제공함을 보여준다.
제안 방법
- 레마 1을 사용해 미분 가능한 활성화를 갖는 딥 네트워크의 헤시안에 대한 닫힌 형태의 표현식을 유도한다.
- 헤시안 고유값에 대한 경계를 사용해 볼록 최적화를 통해 감도 인증을 계산할 수 있는 이론적 조건을 설정한다.
- 최소 $\ell_2$ 거리에 대한 날카운 효율적 계산이 가능한 감도 인증의 하한으로 곡률 기반 안정성 인증(CRC)을 제안한다.
- 훈련 중 정규화로 사용할 수 있는, 곡률(헤시안 고유값)에 대한 미분 가능한 상한을 제안한다.
- 곡률 경계를 정규화 항으로 통합하여 네트워크 곡률을 최소화하면서도 정확도를 유지하는 곡률 기반 안정성 훈련(CRT)을 개발한다.
- 이중성 이론을 사용해 인증 문제와 공격 문제 간의 관계를 설정함으로써, 검증 가능한 조건 하에서 증명 가능하게 가장 가까운 적대적 예제를 효율적으로 계산할 수 있도록 한다.
실험 결과
연구 질문
- RQ1헤시안 고유값과 같은 두 번째 차수 정보를 사용하면, IBP와 같은 일阶 방법보다 더 날카운 감도 인증을 더 효율적으로 유도할 수 있는가?
- RQ2딥 네트워크의 곡률에 대한, 훈련 중 정규화로 사용할 수 있는, 미분 가능한 상한을 계산할 수 있는가?
- RQ3정규화를 통해 네트워크 곡률을 최소화하면, 표준 정확도를 떨어뜨리지 않고도 더 높은 인증된 안정성 정확도를 달성할 수 있는가?
- RQ4CRC 방법이 주어진 입력에 대해 가장 가까운 적대적 예제를 증명 가능하게 식별할 수 있는 조건은 무엇인가?
- RQ5MNIST와 Fashion-MNIST에서 곡률 기반 정규화는 IBP 및 기타 적대적 훈련 기반 방법과 비교해 인증된 안정성 측면에서 어떻게 성능을 발휘하는가?
주요 결과
- CRT는 2층, 3층, 4층 MNIST 네트워크에서 각각 69.79%, 57.78%, 53.19%의 인증된 안정성 정확도를 달성한다—IBP 기반 방법(각각 44.96%, 44.74%, 44.66%)보다 뚜렷이 뛰어나다.
- 적대적 훈련 없이도 곡률 정규화는 비현저한 인증된 안정성 정확도를 가능하게 한다—2-, 3-, 4층 시그모이드 네트워크에서 각각 84.73%, 88.66%, 89.61%이다.
- MNIST에서 2층 네트워크의 44.17%, 3층 네트워크의 22.59%, 4층 네트워크의 19.53%의 경우 CRC 방법이 가장 가까운 적대적 예제를 증명 가능하게 식별한다.
- 작은 곡률 정규화 항($\gamma = 0.005$)을 추가하면 2층 시그모이드 네트워크에서 CRC가 약 ~0.48에서 ~0.83으로 증가하지만, 표준 정확도는 0.5% 미만으로 감소한다.
- CROWN 인증은 곡률 정규화에 따라 약간만 증가하지만, CRC는 상당히 증가함을 확인하여, CRC가 더 날카운 감도 인증임을 시사한다.
- ReLU 및 시그모이드 활성화를 갖는 4층 네트워크에서 곡률 정규화는 적대적 훈련 없이도 인증된 안정성 정확도를 85% 이상으로 끌어올려, 이 방법의 효과성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.