Skip to main content
QUICK REVIEW

[논문 리뷰] Measuring Neural Net Robustness with Constraints

Osbert Bastani, Yani Ioannou|arXiv (Cornell University)|2016. 01. 01.
Adversarial Robustness in Machine Learning참고 문헌 17인용 수 115
한 줄 요약

이 논문은 주어진 입력 주변의 최소 이상치 변형(L∞ 노름 기준)을 추정함으로써 신경망의 강건성을 측정하기 위해 제약 기반 선형 프로그래밍 방법을 제안한다. 이는 이상치 빈도와 심각도라는 두 가지 강건성 지표를 도입하여, 이전 알고리즘으로 생성된 이상치 예제에 과적합되는 것과는 달리, 다양한 평가 기준에서 더 강건한 모델이 되도록 개선된 방법을 제시한다.

ABSTRACT

Despite having high accuracy, neural nets have been shown to be susceptible to adversarial examples, where a small perturbation to an input can cause it to become mislabeled. We propose metrics for measuring the robustness of a neural net and devise a novel algorithm for approximating these metrics based on an encoding of robustness as a linear program. We show how our metrics can be used to evaluate the robustness of deep neural nets with experiments on the MNIST and CIFAR-10 datasets. Our algorithm generates more informative estimates of robustness metrics compared to estimates based on existing algorithms. Furthermore, we show how existing approaches to improving robustness "overfit" to adversarial examples generated using a specific algorithm. Finally, we show that our techniques can be used to additionally improve neural net robustness both according to the metrics that we propose, but also according to previously proposed metrics.

연구 동기 및 목표

  • 이상치 예제에 대한 신뢰할 수 있는 객관적 측정 기준이 부족한 문제를 해결하기 위해.
  • 가장 가까운 이상치 예제까지의 L∞ 거리로 정의된 국소 강건성을 측정 가능한 성질로 형식화하기 위해.
  • 특정 탐색 알고리즘에 의해 생성된 이상치 예제에 과적합되지 않는, 확장성 있고 정확한 강건성 추정 알고리즘을 개발하기 위해.
  • 기존 방법을 사용해 강건성을 향상시킨 모델이 실제로 학습에 사용된 특정 이상치 예제 외부로 일반화되는지 평가하기 위해.
  • 제안된 지표에 따라 강건성 향상이 이루어지는 것뿐만 아니라, 이전 지표와도 일치하는 결과를 도출할 수 있음을 보여주기 위해.

제안 방법

  • 강건성 ρ(f, x*)를 f(x* + r) ≠ f(x*)를 만족하는 최소 L∞ 노름의 변형 r로 정의하고, 이를 제약 최적화 문제로 표현하기.
  • 신경망이 선형인 볼록이고 조각별 선형인 영역 Z(x*) 내에서의 탐색 공간을 제한함으로써 계산이 불가능한 강건성 계산을 근사하기.
  • ReLU 기반 네트워크의 조각별 선형 구조를 활용해 강건성 추정을 선형 프로그래밍(LP) 문제로 모델링하기.
  • 기존 방법 대비 속도를 약 10배 향상시키기 위해 반복적 제약 해결 최적화 기법을 도입하기.
  • 해당 알고리즘(ALP)을 사용해 다양한 데이터셋과 모델에서 이상치 빈도 및 심각도 지표를 추정하기.
  • ALP로 생성된 이상치 예제를 사용해 모델를 미세조정하고, L-BFGS-B 및 기타 기준 모델과 성능 비교하기.

실험 결과

연구 질문

  • RQ1이상치 예제의 빈도와 심각도를 모두 반영하는 공식적이고 정량적인 지표를 통해 강건성을 객관적으로 측정할 수 있는가?
  • RQ2이상치 예제를 생성하는 데 사용된 특정 알고리즘에 따라 신경망의 강건성이 달라지는가?
  • RQ3제약 기반 선형 프로그래밍 접근법이 L-BFGS-B와 같은 기존 최적화 기반 방법보다 더 정확한 강건성 추정을 제공할 수 있는가?
  • RQ4특정 알고리즘에 의해 생성된 이상치 예제에 과적합된 모델이 얼마나 강건성 향상에 영향을 받는가?
  • RQ5제안된 방법이 NiN과 같은 더 깊은 네트워크에 대해 확장 가능하며, 이전에 발견되지 않은 취약점을 드러낼 수 있는가?

주요 결과

  • 제안된 ALP 알고리즘이 L-BFGS-B 기준 대비 훨씬 더 정확한 강건성 추정을 제공하며, 특히 이상치 예제의 진짜 빈도와 심각도를 탐지하는 데 뛰어난 성능을 보인다.
  • L-BFGS-B 알고리즘을 사용해 미세조정한 모델는 ALP 지표 기준으로는 더 약한 강건성을 보이며, 이는 기존 알고리즘 기준에서는 더 강건해 보였기 때문에 과적합이 발생했음을 시사한다.
  • ALP로 미세조정한 모델는 원래 NiN 대비 이상치 빈도(59.6%)는 낮고, 이상치 심각도(3.88 픽셀)는 향상되어 진정된 강건성 향상이 이루어졌음을 보여준다.
  • LeNet에서 ALP로 미세조정한 모델는 이상치 빈도 및 심각도 지표에서 L-BFGS-B로 미세조정한 모델를 모두 앞서며, 이는 ALP 기반 방법이 다양한 이상치 탐색 방법에 더 잘 일반화됨을 확인한다.
  • 반복적 제약 처리를 통해 ALP 알고리즘이 기초적인 LP 솔버 대비 10배 빠른 속도를 달성하여 깊은 네트워크에 대한 강건성 평가가 가능해졌다.
  • CIFAR-10에서의 NiN 모델는 여전히 매우 취약하며, 이상치 빈도가 61.5%로 나타나 현재의 방법들이 대규모 정확한 강건성 향상에 부족함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.