Skip to main content
QUICK REVIEW

[논문 리뷰] Gradient Masking Causes CLEVER to Overestimate Adversarial Perturbation Size

Ian Goodfellow|arXiv (Cornell University)|2018. 04. 21.
Adversarial Robustness in Machine Learning참고 문헌 3인용 수 20
한 줄 요약

이 논문은 CLEVER라는, 적대적 로버스트니의 하한을 추정하기 위해 제안된 방법이 디지털 시스템의 수치 정밀도 한계로 인한 기울기 가림 현상으로 인해 실패함을 보여준다. 모델이 실제로는 로버스트하지 않더라도 CLEVER는 유한 정밀도 계산에 의해 유도되는 비-립시츠 행동을 감지하지 못해 로버스트니를 과대평가한다. 이는 신뢰할 수 있는 로버스트니 측정지표로서의 효과를 상실하게 만든다.

ABSTRACT

A key problem in research on adversarial examples is that vulnerability to adversarial examples is usually measured by running attack algorithms. Because the attack algorithms are not optimal, the attack algorithms are prone to overestimating the size of perturbation needed to fool the target model. In other words, the attack-based methodology provides an upper-bound on the size of a perturbation that will fool the model, but security guarantees require a lower bound. CLEVER is a proposed scoring method to estimate a lower bound. Unfortunately, an estimate of a bound is not a bound. In this report, we show that gradient masking, a common problem that causes attack methodologies to provide only a very loose upper bound, causes CLEVER to overestimate the size of perturbation needed to fool the model. In other words, CLEVER does not resolve the key problem with the attack-based methodology, because it fails to provide a lower bound.

연구 동기 및 목표

  • CLEVER가 적대적 로버스트니의 하한을 추정하는 데 있어 모델의 취약성을 신뢰성 있게 측정하는지 조사하기.
  • 유한 정밀도 계산으로 인한 기울기 가림, 특히 이로 인해 CLEVER의 추정이 어떻게 왜곡되는지 밝히기.
  • 수치적 오차로 인한 기울기 관찰의 오류로 인해 CLEVER가 모델이 실제로는 비로버스트일지라도 로버스트하다고 잘못 결론내릴 수 있음을 보여주기.
  • CLEVER가 공격 기반 방법과 동일한 근본적인 결함을 유산한다는 것을 보여주기: 적대적 편향 크기의 진짜 하한을 제공할 수 없다는 점.

제안 방법

  • 입력 함수가 양자화된 신경망(계단 함수)를 사용하는 이론적 반례를 제안하여, 거의 전역적으로 기울기가 0이 되어 CLEVER가 기울기를 관찰하지 못하고 일정한 행동을 유추하게 한다.
  • 폭이 δ인 선형 램프를 사용해 계단 함수의 리프시츠 연속적 근사치를 제안하며, 이는 모델 행동을 유지하지만 δ → 0일수록 기울기 관찰 가능성이 점점 감소한다.
  • 유한 정밀도 계산이 CLEVER에 미치는 영향을 분석하여, 수치 포화(예: 시그모이드 유닛이 0으로 반올림됨)로 인해 기울기가 가려지고 CLEVER가 로버스트니를 과대평가하게 된다고 보여준다.
  • 실제로 수치 오류로 인해 기초 가정인 리프시츠 연속성 위반이 발생했을 때도 CLEVER가 이를 감지할 수 있는 메커니즘이 없음을 분석한다.
  • 측도 이론적 추론을 사용하여, 높은 확률로 CLEVER가 이러한 근사 함수에서 기울기가 0임을 관찰하게 되어 잘못된 로버스트니 추정치를 내놓음을 보여준다.
  • CLEVER가 공격 기반 방법과 동일한 기울기 가림 문제에 취약하여, 신뢰할 수 있는 하한 추정자로서의 역할을 상실함을 주장한다.

실험 결과

연구 질문

  • RQ1CLEVER는 모델을 속이는 데 필요한 적대적 편향 크기의 하한을 신뢰성 있게 추정할 수 있는가?
  • RQ2유한 정밀도 계산으로 인한 기울기 가림 현상이 CLEVER의 모델 로버스트니 추정에 어떤 영향을 미치는가?
  • RQ3CLEVER는 디지털 시스템 내 수치 근사로 인해 발생하는 비-리프시츠 행동을 감지하지 못하는가?
  • RQ4실제로는 높은 취약성을 지닌 모델이 기울기 가림으로 인해 CLEVER에 의해 잘못 평가되어 로버스트하다고 판단될 수 있는가?
  • RQ5CLEVER는 공격 기반 로버스트니 평가 방법의 한계를 어느 정도 유산하는가?

주요 결과

  • CLEVER는 진짜 기울기가 큰 영역에서 기울기가 0으로 관찰되므로, 모델이 실제로는 일정하지 않음에도 불구하고 일정하다고 결론내어 로버스트니를 과대평가할 수 있다.
  • 무한 정밀도가 있다고 해도, CLEVER는 계단 맵핑과 같은 비-리프시츠 함수에서는 실패한다. 이러한 함수는 임의로 작은 기울기 관찰 가능성이 되는 리프시츠 연속 함수로 근사 가능하다.
  • 실제로는 유한 정밀도 계산으로 인해 활성화 함수의 수치 포화(예: 시그모이드 유닛이 기울기를 0으로 반올림함)로 인해 CLEVER가 로버스트니를 잘못 추정한다.
  • 리프시츠 근사의 폭 δ가 감소할수록 CLEVER의 샘플링에서 비영 기울기 관찰 확률이 거의 0으로 떨어지며, 이는 잘못된 로버스트니 결론을 이끈다.
  • CLEVER는 수치 오차로 인해 가정이 위반되었을 때 이를 감지할 수 있는 메커니즘이 없어, 높은 점수가 실제 로버스트니를 반영하지 못하는 암묵적 실패를 겪는다.
  • CLEVER가 공격 기반 방법과 동일한 기울기 가림 문제에 취약하므로, 적대적 편향 크기의 타당한 하한을 제공하지 못한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.