Skip to main content
QUICK REVIEW

[논문 리뷰] Fooling Adversarial Training with Inducing Noise

Zhirui Wang, Yifei Wang|arXiv (Cornell University)|2021. 11. 19.
Adversarial Robustness in Machine Learning참고 문헌 26인용 수 4
한 줄 요약

이 논문은 적대적 훈련된 모델의 치명적인 강건성 저하를 유도하기 위해 일관된 오분류 타겟을 가진 적대적으로 설계된 노이즈를 주입하는 새로운 데이터 풀링 기법 ADVIN을 제안한다. 기존의 풀링 방법들이 적대적 훈련에서 실패하는 것과는 달리, ADVIN은 AT 모델의 강건한 특징을 활용하여 제거할 수 없는 효과적인 풀링을 생성하며, CIFAR-10에서 강건 테스트 정확도를 51.7%에서 0.57%로 감소시키고, 표준 테스트 정확도는 13.1%로 유지하면서 훈련 정확도는 100%로 유지한다. 또한 비밀번호 데이터를 무단 학습으로부터 보호한다.

ABSTRACT

Adversarial training is widely believed to be a reliable approach to improve model robustness against adversarial attack. However, in this paper, we show that when trained on one type of poisoned data, adversarial training can also be fooled to have catastrophic behavior, e.g., $<1\%$ robust test accuracy with $>90\%$ robust training accuracy on CIFAR-10 dataset. Previously, there are other types of noise poisoned in the training data that have successfully fooled standard training ($15.8\%$ standard test accuracy with $99.9\%$ standard training accuracy on CIFAR-10 dataset), but their poisonings can be easily removed when adopting adversarial training. Therefore, we aim to design a new type of inducing noise, named ADVIN, which is an irremovable poisoning of training data. ADVIN can not only degrade the robustness of adversarial training by a large margin, for example, from $51.7\%$ to $0.57\%$ on CIFAR-10 dataset, but also be effective for fooling standard training ($13.1\%$ standard test accuracy with $100\%$ standard training accuracy). Additionally, ADVIN can be applied to preventing personal data (like selfies) from being exploited without authorization under whether standard or adversarial training.

연구 동기 및 목표

  • 적대적 훈련이 데이터 풀링에 대해 강건하다는 널리 퍼진 믿음을 도전하기 위해, 새로운 종류의 제거할 수 없는 풀링에 의해 적대적 훈련이 취약해질 수 있음을 입증하는 것.
  • 표준 훈련과 적대적 훈련 모두에 효과적인 풀링 방법을 설계하여, 이전 방법들이 적대적 훈련에 의해 제거되는 한계를 극복하는 것.
  • 자기 사진과 같은 개인 데이터를 학습 불가능하게 만들기 위해, 풀링된 데이터로 훈련된 모델이 표준 훈련과 적대적 훈련 모두에서 실패하도록 보장하는 것.
  • 이전 풀링 방법들이 적대적 훈련 하에서 실패하는 실패 메커니즘을 분석하고, 강건한 특징에서 일관된 오분류 타겟이 필요하다는 점을 규명하는 것.

제안 방법

  • ADVIN은 사전 훈련된 적대적 훈련 모델을 사용해 노이즈를 생성함으로써, 풀링이 비강건한 특징이 아닌 강건한 특징을 악용하도록 보장한다.
  • 모든 클래스에 걸쳐 일관된 오분류 타겟 레이블을 설정함으로써, 적대적 훈련을 약화시키는 체계적 편향을 만든다.
  • 작은 국소적 노이즈 패치(예: 8×8에서 32×32)를 훈련 이미지에 주입함으로써 풀링을 적용하며, 의미적 내용은 유지하면서 모델의 일반화 능력을 저하시킨다.
  • 풀링 생성을 위한 소스 모델은 PGD 기반 적대적 훈련을 사용하여 훈련되며, 이로 인해 풀링이 표준 및 적대적 훈련 방어에 강건해진다.
  • 풀링은 청소된 데이터뿐 아니라 개인 데이터(예: Webface-10)에도 적용되어 실제 개인정보 보호 시나리오에서의 효과를 입증한다.
  • 실험을 통해 ADVIN과 표준 노이즈 유도 방법(STDIN)을 비교하여, ADVIN이 적대적 훈련 하에서 자연 정확도와 강건 정확도를 모두 더 효과적으로 저하시키는 것을 보여준다.

실험 결과

연구 질문

  • RQ1적대적 훈련 하에서도 제거할 수 없는 데이터 풀링이 적대적 훈련을 효과적으로 속일 수 있는가?
  • RQ2왜 표준 훈련에서 성공한 이전의 풀링 방법들이 적대적 훈련이 적용되면 실패하는가?
  • RQ3풀링 설계의 특정 특성(예: 특징 유형, 레이블 일관성) 중 적대적 훈련을 무너뜨리기 위해 필요한 것은 무엇인가?
  • RQ4표준 훈련과 적대적 훈련 모두에 효과적인 풀링 방법을 설계할 수 있는가? 이를 통해 개인 데이터의 진정된 학습 불가능성을 달성할 수 있는가?

주요 결과

  • ADVIN은 CIFAR-10에서 적대적 훈련 하에서 강건 테스트 정확도를 51.7%에서 0.57%로 감소시켜 AT의 치명적인 실패를 입증한다.
  • 표준 훈련 하에서 ADVIN은 13.1%의 자연 테스트 정확도와 100%의 훈련 정확도를 달성하며, 이는 이전 방법들이 달성한 약 15.8%보다 뛰어나다.
  • 더 작은 노이즈 패치(16×16)가 가장 심각한 저하를 유도하며, 자연 정확도 44.16%와 강건 정확도 0.76%를 기록하여 더 큰 패치보다 뛰어나다.
  • Webface-10 데이터셋에서 ADVIN은 적대적 훈련 하에서 자연 정확도를 81.34%에서 40.82%로 감소시키고, 강건 정확도를 43.81%에서 22.69%로 낮춘다.
  • ADVIN은 다양한 모델 아키텍처와 훈련 전략(예: 다양한 정지 기준 및 레이블 할당 방식)에서도 효과를 유지한다.
  • ADVIN은 개인 데이터를 무단 사용으로부터 효과적으로 보호하여, 표준 훈련과 적대적 훈련 모두에서 학습 불가능하게 만든다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.