Skip to main content
QUICK REVIEW

[논문 리뷰] Enhancing Intrinsic Adversarial Robustness via Feature Pyramid Decoder

Guanlin Li, Shuya Ding|arXiv (Cornell University)|2020. 05. 06.
Adversarial Robustness in Machine Learning참고 문헌 27인용 수 4
한 줄 요약

이 논문은 블록 기반 컨volution 신경망(CNN)의 내재적 강건성을 향상시키기 위해 다중 척도 노이즈 제거 및 이미지 복원 모듈을 통합하고 분류 레이어의 리프시츠 상수 제약를 적용한 공격에 관계없는 방어 프레임워크인 특징 피라미드 디코더(FPD)를 제안한다. 다중 작업 및 자기 지율 학습을 사용하는 두 단계 전략으로 $\varepsilon$-근접 노이즈 이미지로 훈련된 FPD 강화 모델은 MNIST, SVHN, CALTECH 데이터셋에서 다양한 화이트박스 및_BLK박스 공격에 대해 상당히 높은 강건성을 확보하며, 표준 및 공격에 의해 훈련된 모델을 능가한다.

ABSTRACT

Whereas adversarial training is employed as the main defence strategy against specific adversarial samples, it has limited generalization capability and incurs excessive time complexity. In this paper, we propose an attack-agnostic defence framework to enhance the intrinsic robustness of neural networks, without jeopardizing the ability of generalizing clean samples. Our Feature Pyramid Decoder (FPD) framework applies to all block-based convolutional neural networks (CNNs). It implants denoising and image restoration modules into a targeted CNN, and it also constraints the Lipschitz constant of the classification layer. Moreover, we propose a two-phase strategy to train the FPD-enhanced CNN, utilizing $ε$-neighbourhood noisy images with multi-task and self-supervised learning. Evaluated against a variety of white-box and black-box attacks, we demonstrate that FPD-enhanced CNNs gain sufficient robustness against general adversarial samples on MNIST, SVHN and CALTECH. In addition, if we further conduct adversarial training, the FPD-enhanced CNNs perform better than their non-enhanced versions.

연구 동기 및 목표

  • 특정 공격에 맞춰진 공격 훈련의 일반화 능력 부족과 높은 계산 비용 문제를 해결하기 위해, 공격에 특화된 데이터에 의존하지 않고 내재적 강건성을 향상시키는 방식을 제안한다.
  • 공격 훈련이나 공격 특화 데이터 없이도 블록 기반 CNN의 본질적 강건성을 향상시키는 공격에 관계없는 방어 프레임워크를 개발한다.
  • 다중 수준의 네트워크에서 노이즈 제거 및 이미지 복원 기능을 통합한 다중 척도 특징 피라미드 디코더를 설계한다.
  • 분류 레이어의 리프시츠 상수를 제약하여 입력 변형에 대한 출력 민감도를 제한한다.
  • 다양한 데이터셋과 공격 유형(화이트박스 및 블랙박스 포함)에서 프레임워크의 효과성을 검증한다.

제안 방법

  • 블록 기반 CNN에 앞단 노이즈 제거 모듈, 이미지 복원 모듈, 중간 노이즈 제거 레이어, 뒷단 노이즈 제거 모듈을 통합하여 다중 척도 특징 수준의 노이즈 제거를 가능하게 한다.
  • 다중 작업 학습(복원 및 분류)과 자기 지율 학습을 동시에 가능하게 하기 위해 $\varepsilon$-근접 노이즈 이미지를 사용하는 두 단계 훈련 전략을 적용한다.
  • 입력 변형에 대한 출력 변동을 제한하기 위해 최종 분류 레이어에 리프시츠 상수 제약을 구현한다.
  • 효율성과 특징 표현을 향상시키기 위해 내부 노이즈 제거 레이어에 버팀목 아키텍처를 적용한다.
  • 청결한 이미지를 정답으로 사용하여 다중 작업 감독을 통해 복원 및 분류 헤드를 동시에 훈련시킨다.
  • 특징 맵 전반에 걸쳐 피라미드 구조를 적용하여 계층적 노이즈 제거 및 복원된 입력에서의 특징 추상화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1공격 훈련이나 공격 특화 데이터에 의존하지 않고도 방어 프레임워크가 CNN의 내재적 강건성을 향상시킬 수 있는가?
  • RQ2제안된 FPD 프레임워크는 다양한 데이터셋에서 화이트박스 및 블랙박스 공격에 대해 얼마나 효과적으로 방어하는가?
  • RQ3다중 척도 노이즈 제거 및 이미지 복원 기능의 통합이 표준 모델 대비 강건성 향상에 얼마나 기여하는가?
  • RQ4분류 레이어의 리프시츠 상수 제약이 변형에 대한 강건성 향상에 실제로 기여하는가?
  • RQ5FPD 프레임워크는 공격 훈련과 효과적으로 조합되어 추가로 강건성을 향상시킬 수 있는가?

주요 결과

  • MNIST에서 FPD 강화 ResNet-101은 $L_{\infty}$-PGD 공격($\epsilon = 8/256$)에 대해 95.2%의 강건 정확도를 기록하여 비강화 모델보다 뚜렷이 높았다.
  • SVHN에서 FPD 강화 모델은 $L_{\infty}$-PGD 공격 하에서 78.4%의 강건 정확도를 유지했으며, 기준 모델은 61.2%였다.
  • CALTECH-101에서 FPD 강화 ResNet-101은 $L_{\infty}$-PGD 공격 하에서 61.78%의 강건 정확도를 기록했으며, 원본 모델 대비 34.64%포인트 높았다.
  • CALTECH-256에서 FPD 강화 ResNet-101은 동일한 공격 조건에서 49.79%의 강건 정확도를 기록했고, 원본 모델은 0.00%를 기록했다.
  • 공격 훈련과 조합된 FPD 강화 모델은 비강화 모델보다 더 높은 강건성을 확보하며 상호 보완적 향상 효과를 보였다.
  • 시각적 분석을 통해 이미지 복원 모듈이 청결한 입력과 공격적 입력 모두에서 매우 유사한 출력을 생성함을 확인하여 효과적인 변형 필터링이 이루어지고 있음을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.