Skip to main content
QUICK REVIEW

[논문 리뷰] On the Benefits of Models with Perceptually-Aligned Gradients

Gunjan Aggarwal, Abhishek Sinha|arXiv (Cornell University)|2020. 05. 04.
Adversarial Robustness in Machine Learning참고 문헌 11인용 수 5
한 줄 요약

이 논문은 낮은 교란 한계(예: ε = 1.0/255)로 적대적 훈련을 수행할 경우, 강력한 적대적 내성은 없음에도 불구하고 시각적으로 목표 클래스와 유사한 기울기를 가지는 모델이 생성됨을 보여준다. 이러한 모델은 표준 훈련 및 고ε 적대적 훈련 모델보다 제로샷 전이 및 약한 감독 하에 국소화 작업에서 뛰어난 성능을 달성한다.

ABSTRACT

Adversarial robust models have been shown to learn more robust and interpretable features than standard trained models. As shown in [\cite{tsipras2018robustness}], such robust models inherit useful interpretable properties where the gradient aligns perceptually well with images, and adding a large targeted adversarial perturbation leads to an image resembling the target class. We perform experiments to show that interpretable and perceptually aligned gradients are present even in models that do not show high robustness to adversarial attacks. Specifically, we perform adversarial training with attack for different max-perturbation bound. Adversarial training with low max-perturbation bound results in models that have interpretable features with only slight drop in performance over clean samples. In this paper, we leverage models with interpretable perceptually-aligned features and show that adversarial training with low max-perturbation bound can improve the performance of models for zero-shot and weakly supervised localization tasks.

연구 동기 및 목표

  • 낮은 적대적 교란 한계(ε)로 훈련된 모델이 시각적으로 일치하는 기울기를 가지는지 조사하기 위해.
  • 이러한 모델의 제로샷 전이 및 약한 감독 하에 국소화 작업에서의 최종 성능을 평가하기 위해.
  • 강력한 내성은 없지만 시각적으로 일치하는 기울기가 일반화 및 해석 가능성 향상에 기여할 수 있는지 판단하기 위해.
  • 제로샷 전이 및 약한 감독 하에 국소화 작업에서 낮은 ε로 적대적 훈련된 모델를 표준 훈련 모델 및 고ε 적대적 훈련 모델과 비교하기 위해.

제안 방법

  • CIFAR-10, SVHN, MNIST, USPS, Restricted ImageNet에서 ℓ∞ 노름 한계(ε ∈ {1.0, 2.0, 4.0, 8.0}/255)를 다양하게 설정한 FGSM 및 PGD 공격를 사용한 적대적 훈련.
  • 기울기 시각화 평가를 통해 입력 이미지와 기울기 사이의 시각적 일치도를 분석하기 위해.
  • 적대적 예제가 목표 클래스와 유사한지 확인하기 위해 대규모 무타겟 PGD 공격(ε = 32.0/255)을 수행하기 위해.
  • SVHN에서 MNIST로, MNIST에서 USPS로의 제로샷 전이 평가를 위해 소스 및 타겟 데이터셋의 검증 정확도를 사용하기 위해.
  • Grad-CAM 기반의 바운딩 박스 추정 및 IoU 기반 메트릭을 사용한 CUB 데이터셋에서의 약한 감독 하에 객체 국소화(WSOL) 수행하기 위해.
  • Top-1 정확도, GT를 알고 있는 국소화 정확도, IoU > 0.5 임계값 하에서의 Top-1 국소화 정확도를 사용한 모델 간 비교하기 위해.

실험 결과

연구 질문

  • RQ1낮은 적대적 교란 한계(ε)로 훈련된 모델도 강력한 내성 없이도 여전히 시각적으로 일치하는 기울기를 가지는가?
  • RQ2시각적으로 일치하는 기울기를 가지는 모델은 제로샷 전이 학습 작업에서 성능 향상을 이끌 수 있는가?
  • RQ3이러한 모델은 자연 훈련 모델 및 고ε 적대적 훈련 모델보다 약한 감독 하에 국소화에서 더 뛰어난 성능을 보이는가?
  • RQ4기울기의 시각적 일치는 일반화 가능한 성질이며, 이는 최종 작업의 일반화 능력을 향상시키는가?

주요 결과

  • 낮은 ε로 훈련된 적대적 모델(예: ε = 1.0/255)은 입력을 교란할 때 기울기가 목표 클래스와 시각적으로 유사한 특성을 보인다.
  • 낮은 적대적 내성(예: ε = 4.0/255일 때 PGD 정확도 34.33%)에도 불구하고, 이러한 모델은 청결한 테스트 세트 정확도가 높으며, CIFAR-10에서 90.95%를 기록한다.
  • SVHN → MNIST 제로샷 작업에서 AT-1 모델은 75.99%의 타겟 정확도를 달성하여 자연 모델의 53.98% 및 고ε 모델을 앞선다.
  • MNIST → USPS 제로샷 작업에서 AT-0.05 모델은 81.81%의 타겟 정확도를 기록하여 자연 모델(75.14%) 및 고ε 모델을 초월한다.
  • CUB에서의 약한 감독 하에 국소화 작업에서 AT-0.5 모델은 77.93%의 Top-1 국소화 정확도를 기록하여 자연 ResNet50(50.0%) 및 기타 AT 모델을 능가한다.
  • 낮은 ε 모델에서의 시각적으로 일치하는 기울기는 큰 교란(ε = 32.0/255) 조건에서도 적대적 예제가 목표 클래스와 유사하게 보이게 하며, 자연 모델은 랜덤 노이즈를 생성하는 것과 대조된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.