Skip to main content
QUICK REVIEW

[논문 리뷰] Defense against Adversarial Attacks Using High-Level Representation Guided Denoiser

Fangzhou Liao, Ming Liang|arXiv (Cornell University)|2017. 12. 08.
Adversarial Robustness in Machine Learning참고 문헌 24인용 수 22
한 줄 요약

이 논문은 정상 이미지와 악성 이미지 간의 상위 레이어 모델 출력 차이를 이용해 노이즈 제거기(데노이저)를 훈련시는 High-Level Representation Guided Denoiser (HGD)를 제안한다. 이는 표준 데노이저에서 관찰되는 오차 증폭 효과를 극복한다. HGD는 화이트박스 및_BLK-박스 공격에 대해 최고 수준의 강건성을 확보하며, 앙상블 적대적 훈련을 능가하고, NIPS 2017 적대적 방어 경쟁에서 높은 정확도와 빠른 추론 속도로 1등을 차지했다.

ABSTRACT

Neural networks are vulnerable to adversarial examples, which poses a threat to their application in security sensitive systems. We propose high-level representation guided denoiser (HGD) as a defense for image classification. Standard denoiser suffers from the error amplification effect, in which small residual adversarial noise is progressively amplified and leads to wrong classifications. HGD overcomes this problem by using a loss function defined as the difference between the target model's outputs activated by the clean image and denoised image. Compared with ensemble adversarial training which is the state-of-the-art defending method on large images, HGD has three advantages. First, with HGD as a defense, the target model is more robust to either white-box or black-box adversarial attacks. Second, HGD can be trained on a small subset of the images and generalizes well to other images and unseen classes. Third, HGD can be transferred to defend models other than the one guiding it. In NIPS competition on defense against adversarial attacks, our HGD solution won the first place and outperformed other models by a large margin.

연구 동기 및 목표

  • 표준 데노이저에서 관찰되는 오차 증폭 효과를 해결하기 위해, 작은 적대적 편향이 깊은 네트워크 레이어에서 증폭되는 문제를 해결한다.
  • 광범위한 훈련 데이터가 필요 없이 화이트박스 및 블랙박스 적대적 공격에 강건한 방어 방법을 개발한다.
  • 훈련에 사용되지 않은 클래스에 일반화하고, 다양한 타겟 모델 간 전이 가능성을 확보한다.
  • 기존 최고 수준의 방어 방법인 앙상블 적대적 훈련에 비해 추론 속도와 강건성을 향상시킨다.

제안 방법

  • HGD는 픽셀 수준의 재구성 손실이 아닌, 정상 이미지와 재구성된 이미지 간의 로짓(고수준 표현) 차이를 기반으로 한 손실 함수를 사용해 데노이저를 훈련시킨다.
  • 데노이저는 정상 이미지와 재구성된 이미지에 대해 타겟 모델의 예측이 일치하도록 최소화하도록 훈련되어, 적대적 편향을 효과적으로 억제한다.
  • 사전 훈련된 타겟 모델을 이용해 적대적 예제의 전이성을 활용하여 노이즈 제거 과정을 이끌어낸다.
  • HGD는 소규모 이미지 서브셋에서 훈련되며, 다른 이미지 및 미사용 클래스로도 잘 일반화되어 데이터 및 훈련 시간 요구량을 줄인다.
  • 훈련 중 FGSM 및 반복적 공격을 사용하여 평가하고, 모델 앙상블을 통해 강건성을 향상시킨다.
  • HGD는 적대적 입력을 더 쉽게 분류 가능한 형태로 변환하는 반적대적 변환기로 기능하며, 픽셀 수준의 노이즈가 증가하는 경우에도 성능을 유지한다.

실험 결과

연구 질문

  • RQ1고수준 모델 표현을 기반으로 하는 데노이저가 적대적 편향의 영향을 효과적으로 줄일 수 있는가?
  • RQ2상위 레이어 모델 출력을 지도 신호로 사용할 경우, 표준 데노이저에서 관찰되는 오차 증폭 효과를 방지할 수 있는가?
  • RQ3HGD는 훈련 데이터에 포함되지 않은 클래스와 다른 이미지에 대해 소규모 훈련 데이터로도 잘 일반화되는가?
  • RQ4HGD는 훈련에 사용되지 않은 타겟 모델 간 전이 가능성이 있는가, 즉 훈련에 사용되지 않은 모델에 대해서도 방어가 가능한가?
  • RQ5앙상블 적대적 훈련과 같은 최고 수준의 방어 방법과 비교해 HGD는 강건성과 추론 속도에서 어떤 성능을 보이는가?

주요 결과

  • HGD는 NIPS 2017 적대적 방어 경쟁에서 정규화 점수 0.9532를 기록하여 2등 팀(0.9235)을 크게 앞서며 뚜렷한 우위를 보였다.
  • HGD는 화이트박스 및 블랙박스 공격 모두에 대해 뛰어난 강건성을 보였으며, 경쟁에서 91개의 비대상 공격 및 65개의 대상 공격에 대응했다.
  • HGD는 평균 평가 시간 50.24초로, 86.44~127.39초 사이의 최고 경쟁자들보다 빠른 추론 속도를 확보했다.
  • HGD는 훈련에 사용되지 않은 클래스로도 잘 일반화되며, 앙상블 적대적 훈련과 같은 데이터 집약적인 방법과는 달리 소규모 훈련 이미지만으로도 성능을 확보한다.
  • 어떤 경우에서는 픽셀 수준의 노이즈가 증가하지만, HGD는 정상 이미지와 재구성된 이미지의 상위 레이어 예측을 일치시킴으로써 적대적 편향을 효과적으로 억제한다.
  • 2D 히스토GRAM 분석을 통해 HGD의 예측 편향이 원래의 적대적 노이즈와 강하게 상관됨을 확인하여, 유해한 편향의 효과적인 억제를 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.