Skip to main content
QUICK REVIEW

[논문 리뷰] Understanding Adversarial Robustness Through Loss Landscape Geometries

Vinay Uday Prabhu, Dian Ang Yap|arXiv (Cornell University)|2019. 07. 22.
Adversarial Robustness in Machine Learning참고 문헌 13인용 수 11
한 줄 요약

이 논문은 딥 네ural 네트워크에서 적대적 훈련과 손실 곡면 기하학 간의 관계를 필터 정규화를 사용해 시각화함으로써 조사한다. 통찰과는 반대로, 특히 FGSM과 PGD를 사용한 적대적 훈련은 더 날카롭고 혼란스러운 손실 곡면을 초래하며, 이는 강건성이 반드시 더 평탄한 일반화와 관련이 있다는 믿음을 뒤집는다. stAdv 공격은 가장 매끄러운 곡면을 만들어내며, 원본과의 구조적 유사성이 손실 곡면의 더 평탄한 기하학을 촉진할 수 있음을 시사한다.

ABSTRACT

The pursuit of explaining and improving generalization in deep learning has elicited efforts both in regularization techniques as well as visualization techniques of the loss surface geometry. The latter is related to the intuition prevalent in the community that flatter local optima leads to lower generalization error. In this paper, we harness the state-of-the-art "filter normalization" technique of loss-surface visualization to qualitatively understand the consequences of using adversarial training data augmentation as the explicit regularization technique of choice. Much to our surprise, we discover that this oft deployed adversarial augmentation technique does not actually result in "flatter" loss-landscapes, which requires rethinking adversarial training generalization, and the relationship between generalization and loss landscapes geometries.

연구 동기 및 목표

  • 적대적 데이터 증강이 딥 러닝 손실 곡면 기하학에 어떤 영향을 미치는지 조사하기 위해.
  • 적대적 훈련이 더 평탄하고 일반화 가능한 손실 표면을 이끌어낸다는 가설을 검증하기 위해.
  • FGSM, PGD, stAdv와 같은 다양한 적대적 공격 방법이 손실 곡면의 매끄러움에 어떤 영향을 미치는지 비교하기 위해.
  • 손실 곡면 기하학 측면에서 적대적 강건성과 일반화 간의 괴리점을 탐색하기 위해.
  • 최적화 역학과 일반화에 대한 적대적 훈련의 영향에 대한 향후 연구를 장려하기 위해.

제안 방법

  • 다른 가중치 크기를 가진 모델 간의 손실 곡면 기하학을 직접 비교할 수 있도록 필터 정규화를 사용하였다.
  • CIFAR-10에서 ResNet-32 모델을 훈련한 후, FGSM, PGD, stAdv 공격로 생성된 적대적 예제로 증강된 데이터셋을 사용해 미세조정을 수행하였다.
  • ℓ∞-제한된 적대적 공격를 적용함: FGSM은 단일 단계의 변형을 위해, PGD는 반복적이고 투영된 경사 하강법을 위해, stAdv는 기하학적이고 공간적으로 변형된 변형을 위해 사용하였다.
  • 정규화된 필터 방향을 따라 2D 및 3D 투영을 통해 손실 곡면을 시각화하여 곡률과 볼록성의 정도를 평가하였다.
  • 손실 곡면의 매끄러움과 관련해 원본 이미지와 적대적 이미지 간의 구조적 유사도(SSI)를 측정함으로써, 시각적 실재감과의 연관성을 분석하였다.
  • 정상 및 적대적 테스트 세트에서의 상위-1 정확도를 통해 일반화 성능을 비교하였다.

실험 결과

연구 질문

  • RQ1적대적 훈련이 일반적으로 상정하는 바와 같이, 더 평탄하고 볼록한 손실 곡면을 만들어내는가?
  • RQ2다양한 적대적 공격 방법(FGSM, PGD, stAdv)이 손실 곡면의 기하학에 어떤 영향을 미치는가?
  • RQ3원본 이미지와의 시각적 유사도가 높은 적대적 예제와 손실 곡면의 매끄러움 사이에 상관관계가 있는가?
  • RQ4사전 훈련된 모델에서부터의 적대적 미세조정은 첫 훈련과 다른 손실 곡면 기하학을 만들어내는가?
  • RQ5다양한 공격 유형을 조합하면 더 평탄한 손실 곡면과 향상된 일반화를 얻을 수 있는가?

주요 결과

  • 원본 데이터로 훈련된 클리어 모델은 가장 매끄럽고 볼록한 손실 곡면을 보이며, 이는 적대적 훈련이 기하학을 개선한다는 기대와 정면으로 배치된다.
  • FGSM 증강 모델은 FGSM 공격에 대해 강건성을 향상시켰음에도 불구하고, 가장 날카롭고 혼란스러운 손실 곡면을 보였다.
  • PGD 증강 모델은 FGSM 모델만큼 날카롭지는 않지만, 여전히 클리어 모델보다 훨씬 더 혼란스러운 곡면을 보였다.
  • stAdv 증강 모델은 적대적 손실 곡면 중에서 가장 매끄럽게 나타났으며, 이는 원본 이미지와의 높은 구조적 유사도(1-SSIM = 0.0028)와 관련이 있었다.
  • 모든 공격 유형에 걸쳐, 1-SSIM 값이 낮을수록(시각적 유사도가 높을수록) 손실 곡면이 더 매끄럽다는 강한 정적 상관관계가 존재했다.
  • 적대적 미세조정은 모델이 변형을 암기하고, 강건한 특징보다는 구조적 이미지 유사성에 기반해 일반화할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.