Skip to main content
QUICK REVIEW

[논문 리뷰] Blind Pre-Processing: A Robust Defense Method Against Adversarial Examples

Adnan Siraj Rakin, Zhezhi He|arXiv (Cornell University)|2018. 02. 05.
Adversarial Robustness in Machine Learning참고 문헌 22인용 수 9
한 줄 요약

이 논문은 분류기로 들어가는 입력 이전에 은폐된 비선형 변환(탄함, 배치 정규화, 인코딩 기법 포함)을 적용함으로써 딥 네ural 네트워크의 적대적 공격에 대한 강건성을 향상시키는 새로운 방어 기법인 블라인드 프리프로세싱(BP)을 소개한다. 이 방법은 적대적 훈련 없이도 MNIST에서 최고 성능(98.65%)을 달성하며, 강력한 공격 조건에서도 CIFAR-10과 SVHN에서 뛰어난 성능을 유지한다.

ABSTRACT

Deep learning algorithms and networks are vulnerable to perturbed inputs which is known as the adversarial attack. Many defense methodologies have been investigated to defend against such adversarial attack. In this work, we propose a novel methodology to defend the existing powerful attack model. We for the first time introduce a new attacking scheme for the attacker and set a practical constraint for white box attack. Under this proposed attacking scheme, we present the best defense ever reported against some of the recent strong attacks. It consists of a set of nonlinear function to process the input data which will make it more robust over the adversarial attack. However, we make this processing layer completely hidden from the attacker. Blind pre-processing improves the white box attack accuracy of MNIST from 94.3\% to 98.7\%. Even with increasing defense when others defenses completely fail, blind pre-processing remains one of the strongest ever reported. Another strength of our defense is that it eliminates the need for adversarial training as it can significantly increase the MNIST accuracy without adversarial training as well. Additionally, blind pre-processing can also increase the inference accuracy in the face of a powerful attack on CIFAR-10 and SVHN data set as well without much sacrificing clean data accuracy.

연구 동기 및 목표

  • 적대적 훈련에 의존하지 않고 강력한 화이트박스 적대적 공격에 대한 강건성을 향상시키는 방어 기법을 개발하는 것.
  • 공격 강도가 증가하거나 다양한 데이터셋 간에 일반화되지 못하는 기존 방어 기법의 한계를 해결하는 것.
  • 공격자가 프리프로세싱 레이어를 알 수 없도록 하여 실세계 응용(예: 자율주행차)에 적합한 실용적이고 구현 가능한 방어 기법을 도입하는 것.
  • 청소 데이터 정확도를 향상시키면서도 LS-PGA 및 PGD와 같은 강력한 공격 조건에서도 높은 강건성을 유지하는 것.
  • 입력 분포를 강건성에 최적화함으로써 프리프로세싱이 일부 설정에서 적대적 훈련보다 우수한 성능을 낼 수 있음을 보여주는 것.

제안 방법

  • 분류기 이전에 탄함, 배치 정규화, 원핫/온도계 인코딩을 포함한 비가역적이고 은폐된 프리프로세싱 파이프라인을 적용하여 입력 데이터를 변환하는 것.
  • 공격자가 프리프로세싱 레이어를 완전히 알 수 없도록 설계하여 기계적 내장 방어 레이어를 시뮬레이션하고 기울기 기반 공격을 방지하는 것.
  • 모델 가중치, 기울기, 훈련 절차에 접근 가능하지만 블라인드 프리프로세싱 레이어에 접근 불가인 수정된 화이트박스 공격 모델을 사용하는 것.
  • CIFAR-10 주파수 도표에서 나타나는 픽셀 강도 분포 재분포를 활용하여 에지 전이를 증가시켜 소규모 변형의 영향을 줄이는 것.
  • 공격을 받은 데이터 정확도 비율(α)을 최대화하는 방식으로 프리프로세싱 구성 요소(예: tanh+BN, 필터+BN)의 조합을 최적화하는 것. 이는 청소 및 강건 정확도를 균형 잡는 지표이다.
  • 실세계 구현 환경을 반영하기 위해 화이트박스 공격에 실용적 제약 조건을 도입하여 오버옵timistic한 가려진 기울기 방어의 문제를 해결하는 것.

실험 결과

연구 질문

  • RQ1적대적 훈련 없이도 MNIST에서 높은 강건성을 달성할 수 있는 방어 기법을 설계할 수 있는가?
  • RQ2블라인드 프리프로세싱은 입력 픽셀 강도 분포에 어떤 영향을 미치며, 이는 적대적 강건성에 기여하는가?
  • RQ3LS-PGA 및 이산 데이터에서의 프로젝션 기반 기울기 강하 공격과 같이 점점 강력해지는 공격 조건에서도 방어 기법이 효과를 유지할 수 있는가?
  • RQ4MNIST에서는 잘 작동하는 배치 정규화가 왜 CIFAR-10에서는 실패하는가? 이는 프리프로세싱 구성 요소 선택에 어떤 영향을 미치는가?
  • RQ5공격을 받은 데이터 정확도 비율(α)이 다양한 데이터셋과 프리프로세싱 조합에서 전체 방어 성능과 얼마나 상관이 있는가?

주요 결과

  • 블라인드 프리프로세싱은 적대적 훈련 없이도 MNIST에서 테스트 정확도 98.65%를 달성하여, 훈련 과정에서 적대적 데이터를 사용하지 않은 채로는 처음으로 이 성능를 달성한 것이다.
  • 탄함과 배치 정규화의 조합가 가장 높은 공격을 받은 데이터 정확도 비율(α = 49.8)을 기록하여 강력한 강건성을 보였지만, 더 큰 데이터셋에서는 청소 정확도가 약간 떨어지는 경향이 있었다.
  • CIFAR-10과 SVHN에서는 높은 강건성을 유지하지만, 각각 86%와 95% 정확도로 복구하기 위해 적대적 훈련이 필요함을 시사하며, 청소 정확도와 강건성 사이의 상충 관계를 보여준다.
  • LS-PGA 및 이산 데이터에서 수정된 PGD 공격과 같은 강력한 공격 조건에서도 최근의 방어 기법들을 능가하는 성능을 보이며 뛰어난 내성 강도를 입증한다.
  • 픽셀 분포 분석 결과, 탄함 처리가 표준편차를 증가시키고 픽셀 값을 산산이 흩트려 에지 전이를 특히 강화함으로써 소규모 적대적 변형의 영향을 감소시킨다.
  • 공격자가 은폐된 프리프로세싱 레이어를 역공학할 수 없기 때문에 설계상으로 가려진 기울기 공격에 효과적으로 대응하며, 기울기 기반 공격이 무력화된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.