Skip to main content
QUICK REVIEW

[논문 리뷰] Batch Normalization Increases Adversarial Vulnerability: Disentangling Usefulness and Robustness of Model Features

Philipp Benz, Chaoning Zhang|arXiv (Cornell University)|2021. 05. 04.
Adversarial Robustness in Machine Learning참고 문헌 32인용 수 12
한 줄 요약

이 논문은 로컬 선형성 기반 메트릭인 LIGS를 사용하여 딥 네ural 네트워크 특징을 강건한 유용성(F robustness)과 표준 유용성(F usefulness)으로 분리하는 프레임워크를 제안한다. 분석 결과 배치 정규화는 모델의 의존성을 비강건 특징 쪽으로 이동시켜 적대적 공격에 대한 취약성을 높인다는 점을 확인했으며, 이는 정규화 기법 전반에 걸쳐 확인되었고, 특징 이동 가능성 및 손상에 대한 강건성 분석을 통해 뒷받 Cir.

ABSTRACT

Batch normalization (BN) has been widely used in modern deep neural networks (DNNs) due to fast convergence. BN is observed to increase the model accuracy while at the cost of adversarial robustness. We conjecture that the increased adversarial vulnerability is caused by BN shifting the model to rely more on non-robust features (NRFs). Our exploration finds that other normalization techniques also increase adversarial vulnerability and our conjecture is also supported by analyzing the model corruption robustness and feature transferability. With a classifier DNN defined as a feature set F we propose a framework for disentangling F robust usefulness into F usefulness and F robustness. We adopt a local linearity based metric, termed LIGS, to define and quantify F robustness. Measuring the F robustness with the LIGS provides direct insight on the feature robustness shift independent of usefulness. Moreover, the LIGS trend during the whole training stage sheds light on the order of learned features, \ie from RFs (robust features) to NRFs, or vice versa. Our work analyzes how BN and other factors influence the DNN from the feature perspective. Prior works mainly adopt accuracy to evaluate their influence regarding F usefulness, while we believe evaluating F robustness is equally important, for which our work fills the gap.

연구 동기 및 목표

  • 표준 정확도를 넘어서 딥 네ural 네트워크 특징의 적대적 강건성 평가에 대한 격차를 메우기 위해.
  • 수렴성과 정확도를 향상시키는 데 기여함에도 불구하고 배치 정규화가 왜 적대적 취약성을 증가시키는지 탐구하기 위해.
  • 학습된 특징의 강건한 유용성을 그들 각각의 구성 요소인 유용성과 강건성으로 분리하기 위해.
  • 정규화 기법이 강건한 특징과 비강건한 특징에 대한 학습 순서와 의존성에 어떻게 영향을 주는지 정량화하기 위해.
  • 모델 정확도와는 독립적인 특징 강건성의 직접적이고 정량적인 측정 방법을 제공하기 위해.

제안 방법

  • 딥 네ural 네트워크의 특징 세트 F를 F usefulness 및 F robustness 성분으로 분해하는 프레임워크를 제안한다.
  • 로컬 선형성에 기반한 메트릭인 LIGS(Local Intrinsic Gradient Stability)를 도입하여 F robustness를 정량화한다.
  • LIGS를 사용해 전체 학습 과정 동안의 강건성 추세를 측정하여 특징이 학습되는 순서를 추론한다.
  • 강건성 이동 가설을 검증하기 위해 특징 이동 가능성과 손상에 대한 강건성 분석을 수행한다.
  • 배치 정규화와 다른 정규화 기법을 비교하여 적대적 취약성에 미치는 공통적 영향을 평가한다.
  • 특징 표현 F의 소스로 분류기 DNN을 사용하여 특징 수준의 행동을 분석할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1배치 정규화는 비강건 특징에 대한 모델 의존성을 증가시켜 적대적 공격에 대한 취약성을 높이는가?
  • RQ2배치 정규화 이외의 다른 정규화 기법들도 유사한 강건성 열화를 유도하는가? 이는 더 넓은 범위의 현상일 수 있는가?
  • RQ3로컬 선형성 기반 메트릭을 사용해 유용성과는 독립적으로 특징 강건성을 정량적으로 측정할 수 있는가?
  • RQ4특징 학습의 시간적 순서는 어떻게 되는가? 강건한 특징이 비강건한 특징보다 먼저 학습되는가, 아니면 그 반대인가?
  • RQ5특징 강건성은 이동 가능성과 손상에 대한 강건성과 어떻게 관련이 있는가?

주요 결과

  • LIGS 기반 강건성 분석을 통해 배치 정규화는 비강건 특징(NRFs)에 대한 모델 의존성을 높여 적대적 공격에 대한 취약성을 증가시킨다는 점이 확인되었다.
  • 배치 정규화 이외의 다른 정규화 기법 역시 적대적 취약성을 증가시키며, 이는 정규화 메커니즘과 관련된 더 넓은 경향성을 시사한다.
  • LIGS는 특징 강건성을 효과적으로 정량화하며, 강건성 이동 현상이 모델 정확도나 유용성과는 독립적으로 발생한다는 점을 드러낸다.
  • LIGS의 학습 궤적은 명확한 경향을 보이며, 특히 배치 정규화 하에서는 강건한 특징이 비강건한 특징보다 먼저 학습된다는 것을 보여준다.
  • 특징 이동 가능성과 손상에 대한 강건성은 LIGS 기반 강건성과 강하게 상관관계가 있으며, 이는 메트릭의 신뢰성을 검증한다.
  • 특징 강건성 평가가 모델 정확도 평가와 별개로 필수적임을 입증하였으며, DNN 평가 분야에서 중요한 격차를 메웠다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.