Skip to main content
QUICK REVIEW

[논문 리뷰] Improved deterministic l2 robustness on CIFAR-10 and CIFAR-100

Sahil Singla, Surbhi Singla|arXiv (Cornell University)|2021. 08. 05.
Adversarial Robustness in Machine Learning인용 수 11
한 줄 요약

이 논문은 CIFAR-10 및 CIFAR-100에서 1-Lipschitz CNN의 결정론적 l² 내성 향상을 위해 마지막 레이어 정규화(Last Layer Normalization, LLN)를 제안한다. 마지막 레이어의 가중치를 단위 노름으로 정규화하면서 방향 업데이트를 允허함으로써 학습 중 치명적인 기억 상실을 방지하며, 표준 정확도와 증명 가능한 내성 정확도 양면에서 뚜렷한 향상을 이룬다. 이는 새로운 하우스홀더 활성화 함수와 증명 정규화를 통해 달성되었으며, CIFAR-100에서 각각 +4.80%와 +4.71%의 성능 향상을 기록했다.

ABSTRACT

Training convolutional neural networks (CNNs) with a strict Lipschitz constraint under the $l_{2}$ norm is useful for provable adversarial robustness, interpretable gradients and stable training. While $1$-Lipschitz CNNs can be designed by enforcing a $1$-Lipschitz constraint on each layer, training such networks requires each layer to have an orthogonal Jacobian matrix (for all inputs) to prevent the gradients from vanishing during backpropagation. A layer with this property is said to be Gradient Norm Preserving (GNP). In this work, we introduce a procedure to certify the robustness of $1$-Lipschitz CNNs by relaxing the orthogonalization of the last linear layer of the network that significantly advances the state of the art for both standard and provable robust accuracies on CIFAR-100 (gains of $4.80\%$ and $4.71\%$, respectively). We further boost their robustness by introducing (i) a novel Gradient Norm preserving activation function called the Householder activation function (that includes every $\mathrm{GroupSort}$ activation) and (ii) a certificate regularization. On CIFAR-10, we achieve significant improvements over prior works in provable robust accuracy ($5.81\%$) with only a minor drop in standard accuracy ($-0.29\%$). Code for reproducing all experiments in the paper is available at \url{https://github.com/singlasahil14/SOC}.

연구 동기 및 목표

  • 최종 레이어의 가중치 행렬에 대한 직교 제약 조건을 적용할 때 1-Lipschitz CNN에서 발생하는 치명적인 기억 상실 문제를 해결하기 위해.
  • 최종 선형 레이어에 대한 엄격한 직교성 요구 조건을 완화함으로써 CIFAR-100에서 증명 가능한 내성 정확도를 향상시키기 위해.
  • 최종 가중치 행렬이 직교가 아니어도 되는 새로운 증명 방법을 개발하여 더 유연하고 효과적인 학습을 가능하게 하기 위해.
  • 그룹소트를 일반화하고 계층 간 기울기 노름 유지 기능을 제공하는 새로운 기울기 노름 유지 활성화 함수(Householder 활성화 함수)를 제안하기 위해.
  • 증명 정규화를 통해 내성을 향상시키고 다양한 아키텍처와 데이터셋 분할에 걸쳐 일관된 성능 향상을 입증하기 위해.

제안 방법

  • 최종 가중치 행렬의 모든 행을 단위 노름으로 정규화하면서도 학습 중 방향은 자유롭게 변화시킬 수 있도록 하는 Last Layer Normalization(LLN)를 제안한다.
  • 새로운 내성 증명을 도입한다: $ \min_{i \neq l} \frac{f_l(\mathbf{x}) - f_i(\mathbf{x})}{\|\mathbf{W}_{l,:} - \mathbf{W}_{i,:}\|_2} $, 이는 최종 레이어가 직교가 아닐 경우에도 유효하다.
  • 하우스홀더 활성화 함수(HH)를 설계하였으며, 이는 GNP 활성화 함수로서 그룹소트를 일반화하고 계층 간 기울기 노름 유지 기능을 제공한다.
  • 증명 정규화(CR)를 적용하여 정답 클래스와 오답 클래스 간 로짓 간 거리를 더 크게 유지하도록 유도함으로써 내성을 추가로 향상시킨다.
  • 최종 레이어의 노름을 1로 제약하면서도 방향은 자유롭게 업데이트하는 수정된 학습 절차를 사용하여, 나머지 모든 행의 업데이트가 필요 없도록 한다.
  • LLN, HH 활성화 함수, CR의 조합을 통해 증명 가능한 l² 내성 하에서 CIFAR-10 및 CIFAR-100에서 최신 기술 수준의 성능을 달성한다.

실험 결과

연구 질문

  • RQ11-Lipschitz CNN의 최종 레이어에 대해 직교성 제약 조건을 완화하면, 증명 유효성은 유지하면서 내성 성능 향상이 가능한가?
  • RQ2Last Layer Normalization(LLN)는 CIFAR-100과 같은 고클래스 수 설정에서 치명적인 기억 상실을 어떻게 완화하는가?
  • RQ3그룹소트에 비해 하우스홀더 활성화 함수는 훈련 안정성과 내성 성능 향상에 얼마나 기여하는가?
  • RQ4증명 정규화는 1-Lipschitz 네트워크에서 증명 가능한 내성 정확도를 추가로 향상시킬 수 있는가?
  • RQ5LLN, HH 활성화 함수, CR의 병합 효과는 다양한 아키텍처에서 표준 정확도와 증명 가능한 내성 정확도에 어떤 영향을 미치는가?

주요 결과

  • CIFAR-100에서 제안된 방법은 이전 최신 기술 수준 대비 표준 정확도 4.80% 향상 및 ρ = 36/255일 때 증명 가능한 내성 정확도 4.71% 향상을 달성했다.
  • CIFAR-10에서는 ρ = 36/255일 때 표준 정확도 감소율 0.29%에 불과한 5.81%의 증명 가능한 내성 정확도를 달성했다.
  • LLN, 하우스홀더 활성화 함수, 증명 정규화의 조합은 CIFAR-10 및 CIFAR-100의 모든 테스트 아키텍처에서 일관된 성능 향상을 이끌어냈다.
  • 절단 분석 결과, SOC 기준 대비 LLN만으로도 CIFAR-100에서 표준 정확도 최대 4.80% 향상 및 증명 가능한 내성 정확도 최대 4.80% 향상을 기록했다.
  • 증명 정규화는 점진적이나도 측정 가능한 향상을 제공하였으며, 깊은 네트워크(LipConvnet-40)에서는 증명 가능한 내성 정확도 최대 2.85% 향상을 기록했다.
  • 이 방법은 다양한 네트워크 깊이와 아키텍처에서도 높은 성능를 유지하며, 다양한 환경에서의 내성과 일반화 능력을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.