Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Robust Deep Neural Networks

Timothy E. Wang, Jack Gu|arXiv (Cornell University)|2018. 10. 27.
Adversarial Robustness in Machine Learning참고 문헌 32인용 수 10
한 줄 요약

이 논문은 $l_∞$-제한된 입력 변형에 대한 민감도를 최소화함으로써 딥 네ural 네트워크의 강건성을 향상시키는 새로운 손실 함수를 제안한다. 이는 과도하게 근사한 출력 도달 가능 집합에서 유도된 부피 기반 민감도 측도를 사용한다. 실험 결과, 명시적인 적대적 훈련 없이도 기존 방법들에 비해 우수한 강건성과 더 낮은 민감도를 달성하면서 일반화 성능도 향상됨을 보였다.

ABSTRACT

We investigate the topics of sensitivity and robustness in feedforward and convolutional neural networks. Combining energy landscape techniques developed in computational chemistry with tools drawn from formal methods, we produce empirical evidence indicating that networks corresponding to lower-lying minima in the optimization landscape of the learning objective tend to be more robust. The robustness estimate used is the inverse of a proposed sensitivity measure, which we define as the volume of an over-approximation of the reachable set of network outputs under all additive $l_{\infty}$-bounded perturbations on the input data. We present a novel loss function which includes a sensitivity term in addition to the traditional task-oriented and regularization terms. In our experiments on standard machine learning and computer vision datasets, we show that the proposed loss function leads to networks which reliably optimize the robustness measure as well as other related metrics of adversarial robustness without significant degradation in the classification error. Experimental results indicate that the proposed method outperforms state-of-the-art sensitivity-based learning approaches with regards to robustness to adversarial attacks. We also show that although the introduced framework does not explicitly enforce an adversarial loss, it achieves competitive overall performance relative to methods that do.

연구 동기 및 목표

  • 최적화 경로의 국소 최소점 에너지와 신경망 강건성 간의 관계를 탐구하는 것.
  • $l_\infty$-제한된 입력 변형 하에서 과도하게 근사한 출력 도달 가능 집합의 부피 기반 민감도 측도를 개발하는 것.
  • 명시적인 적대적 손실에 의존하지 않고 높은 민감도를 방지하기 위해 강건성을 최적화하는 학습 프레임워크를 설계하는 것.
  • 훈련된 모델에서 분류 정확도, 민감도, 적대적 강건성 간의 상호 상관 관계를 평가하는 것.

제안 방법

  • 훈련 샘플에 대해 $l_\infty$-제한된 입력 변형 하에서 과도하게 근사한 출력 도달 가능 집합의 총 부피를 민감도 측도로 도입한다.
  • 각 입력 샘플에 대해 도달 가능한 출력 집합을 추정하기 위해 Reluplex와 선형 프로그래밍 근사 기법을 활용한다.
  • 기본 교차 엔트로피 손실과 정규화 항에 더해 민감도 페널티 항을 포함한 새로운 손실 함수를 제안한다.
  • 에너지 경로 분석을 통해 낮은 에너지 최소점이 낮은 네트워크 민감도와 더불어 강건성을 향상시킴을 확인한다.
  • 계산 화학 및 형식적 방법 분야의 공식 검증 기법을 활용해 민감도의 상한을 추정한다.
  • 제안된 손실 함수를 사용해 네트워크를 훈련하고, MNIST 및 CIFAR-10 데이터셋에서 강건성을 평가한다.

실험 결과

연구 질문

  • RQ1최적화 경로의 국소 최소점 에너지와 해당 신경망의 민감도 사이에 상관관계가 존재하는가?
  • RQ2제한된 입력 변형 하에서 출력 도달 가능 집합의 부피를 줄이면 적대적 강건성이 향상되는가?
  • RQ3민감도 기반 훈련은 적대적 훈련에 비해 강건성과 일반화 성능에서 어떻게 비교되는가?
  • RQ4명시적인 적대적 손실 없이도 민감도 최소화가 적대적 강건성을 향상시키는가?
  • RQ5제안된 프레임워크에서 민감도, 분류 정확도, 적대적 강건성 간의 상호 상관 관계는 어떠한가?

주요 결과

  • MNIST 테스트 데이터에서 제안된 방법은 기준값($1.27 \times 10^{12}$)과 K&W($2.12 \times 10^5$)에 비해 훨씬 낮은 민감도 측도 $8.65 \times 10^3$을 달성했다.
  • MNIST 테스트 데이터에서 제안된 방법은 분류 성능에서 기준값($0.082$)과 K&W($0.262$)에 비해 뛰어난 교차 엔트로피 손실 $\mathbf{0.125}$를 기록했다.
  • 명시적인 적대적 오차 최소화 없이도, 제안된 방법은 적대적 오차를 $24.5\%$로 줄여 기준값($91.23\%$)을 능가하고 K&W($14.54\%$)에 가까이 다가섰다.
  • 낮은 민감도와 향상된 적대적 강건성 간에 강한 상관관계가 있음을 확인했으며, 민감도 감소가 낮은 적대적 손실로 이어짐을 입증했다.
  • 에너지 경로 분석을 통해 낮은 에너지 최소점은 낮은 민감도를 가지는 네트워크와 관련이 있음을 밝혀내어, 최적화 경로의 특성이 강건성에 영향을 준다는 가설을 뒷받침했다.
  • 민감도, 적대적 강건성, 분류 정확도 간의 유리한 트레이드오프를 달성했으며, 일반화 성능에서는 K&W를 능가하면서도 경쟁 가능한 강건성을 유지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.