Skip to main content
QUICK REVIEW

[논문 리뷰] On the Tightness of Semidefinite Relaxations for Certifying Robustness to Adversarial Examples

Richard Y. Zhang|arXiv (Cornell University)|2020. 06. 11.
Adversarial Robustness in Machine Learning인용 수 4
한 줄 요약

이 논문은 ReLU 신경망에서의 내성적 안정성 인증을 위한 정규화된 준선형계획법(SDP) 근사의 날카움을 분석하기 위해 기하학적 프레임워크를 제안한다. 이는 약간의 조건 하에 단일 은닉층 신경망에서 SDP 근사가 정확하다(즉, 전역 최적의 대비 공격 변형을 도출함)는 것을 증명하며, 비선형 초구형체 위로 점을 투영하는 방식을 분석하여 깊은 네트워크에서 왜 이 근사가 보수적으로 작용하는지 설명한다.

ABSTRACT

The robustness of a neural network to adversarial examples can be provably certified by solving a convex relaxation. If the relaxation is loose, however, then the resulting certificate can be too conservative to be practically useful. Recently, a less conservative robustness certificate was proposed, based on a semidefinite programming (SDP) relaxation of the ReLU activation function. In this paper, we describe a geometric technique that determines whether this SDP certificate is exact, meaning whether it provides both a lower-bound on the size of the smallest adversarial perturbation, as well as a globally optimal perturbation that attains the lower-bound. Concretely, we show, for a least-squares restriction of the usual adversarial attack problem, that the SDP relaxation amounts to the nonconvex projection of a point onto a hyperbola. The resulting SDP certificate is exact if and only if the projection of the point lies on the major axis of the hyperbola. Using this geometric technique, we prove that the certificate is exact over a single hidden layer under mild assumptions, and explain why it is usually conservative for several hidden layers. We experimentally confirm our theoretical insights using a general-purpose interior-point method and a custom rank-2 Burer-Monteiro algorithm.

연구 동기 및 목표

  • 준선형계획법(SDP) 근사가 ReLU 활성화 함수에 대해 언제 정확한 안정성 인증을 도출하는지 이해하기 위해.
  • 깊은 신경망에서 보수적이고 정확한 안정성 인증 간 격차를 해결하기 위해.
  • SDP 근사가 날카로운지, 즉 대비 공격 문제에서 전역 최적을 달성하는지 판단하기 위한 기하학적 방법을 개발하기 위해.
  • SDP 기반 인증이 이전 방법보다 덜 보수적이지만 깊은 네트워크에서는 왜 자주 보수적인지 설명하기 위해.

제안 방법

  • 논문은 대비 공격 문제를 최소제곱 최적화 문제로 재구성하고 이를 비선형 투영 문제의 시퀀스로 분해한다.
  • 최종 근사 단계를 고차원 공간 내 비볼록 초구형체 위로 점을 투영하는 것으로 모델링한다.
  • SDP 근사의 날카움은 이 투영이 초구형체의 주축 위에 위치하는지 여부에 의해 결정된다.
  • 비선형 문제를 효율적으로 해결하고 비직교 성분의 잔차가 0이 되는 지점을 통해 전역 최적성을 탐지하기 위해 랭크-2 Burer-Monteiro 인수분해를 사용한다.
  • 행렬 완성 및 저랭크 최적화 이론을 적용하여 정확한 해가 인수분해된 공간에서 랭크-1 해에 해당함을 증명한다.
  • 내부점 방법과 다수의 무작위 재시작을 포함한 맞춤형 랭크-2 Burer-Monteiro 알고리즘을 사용하여 방법을 검증한다.

실험 결과

연구 질문

  • RQ1ReLU 활성화 함수의 SDP 근사가 대비 안정성 인증에서 언제 기하학적 조건을 만족해 날카로워지는가?
  • RQ2SDP 기반 인증이 이전 방법보다 덜 보수적인 이유는 무엇이며, 언제 정확하지 않아지는가?
  • RQ3투영된 점의 위치가 초구형체의 주축과의 관계에 따라 SDP 근사의 날카움을 특성화할 수 있는가?
  • RQ4약간의 조건 하에 단일 은닉층 ReLU 네트워크에서 SDP 근사는 정확한가?
  • RQ5다중 은닉층을 가진 깊은 네트워크에서 SDP 인증의 보수성 증가 원인은 무엇인가?

주요 결과

  • 약간의 조건 하에 단일 은닉층 ReLU 네트워크에서 SDP 근사는 정확하며, 이는 최적의 점이 초구형체의 주축 위에 투영됨에 따라 발생한다.
  • SDP 근사는 비선형 투영 문제의 해가 초구형체의 주축 위에 있을 때에만 날카로워진다.
  • 더 깊은 네트워크에서는 일반적으로 투영이 주축 위에 있지 않아, 관측된 SDP 인증의 보수성 원인을 설명한다.
  • 실험 결과는 SDP 근사가 날카로울 경우 랭크-2 Burer-Monteiro 알고리즘이 항상 랭크-1 해로 수렴함을 확인하며, 이는 전역 최적성을 나타낸다.
  • 근사가 느슨할 경우 알고리즘은 비영인 비직교 성분을 가진 해로 자주 수렴하며, 이는 부분 최적성을 시사한다.
  • 기하학적 특성화는 SDP 기반 안정성 인증에서 단일층과 다중층 네트워크 간 실용적 성능 격차에 대한 이론적 설명을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.