Skip to main content
QUICK REVIEW

[논문 리뷰] Adversarial Examples Make Strong Poisons

Liam Fowl, Micah Goldblum|arXiv (Cornell University)|2021. 06. 21.
Adversarial Robustness in Machine Learning참고 문헌 52인용 수 33
한 줄 요약

이 논문은 고정된 사전학습 모델에서 만들어진 적대적 예제가 학습에 사용될 때 매우 효과적인 데이터 오염제로 작용하여 일반화 능력을 저하시키거나 파괴할 수 있음을 보여주며, 종전의 오염 방법들보다 종종 더 우수한 성능을 보인다. 클래스 타깃 적대적 오염 변형은 ImageNet과 같은 대형 데이터셋에서 특히 강력한 효과를 발휘하며, 방어 연구를 촉진하기 위해 ImageNet-P를 공개한다.

ABSTRACT

The adversarial machine learning literature is largely partitioned into evasion attacks on testing data and poisoning attacks on training data. In this work, we show that adversarial examples, originally intended for attacking pre-trained models, are even more effective for data poisoning than recent methods designed specifically for poisoning. Our findings indicate that adversarial examples, when assigned the original label of their natural base image, cannot be used to train a classifier for natural images. Furthermore, when adversarial examples are assigned their adversarial class label, they are useful for training. This suggests that adversarial examples contain useful semantic content, just with the ``wrong'' labels (according to a network, but not a human). Our method, adversarial poisoning, is substantially more effective than existing poisoning methods for secure dataset release, and we release a poisoned version of ImageNet, ImageNet-P, to encourage research into the strength of this form of data obfuscation.

연구 동기 및 목표

  • 데이터 오염을 이용한 가용성 공격으로의 동기를 부여하고 이를 적대적 예제와 연결한다.
  • 고정 모델을 바탕으로 제작된 간단하고 효과적인 오염 방법으로서의 적대적 오염을 제안한다.
  • 이식성 및 강력함을 보여주기 위해 CIFAR-10, ImageNet, 얼굴 인식 전반에 걸쳐 평가한다.
  • 왜 적대적 예제가 강력한 오염제로 작용하는지 분석하고 방어 효과를 조사한다.

제안 방법

  • 손실에 대해 고정된 정결한 모델(theta*)에 관해 변조를 만들고 이를 통해 경험적 손실 최대화를 수행하여 오염을 형성한다.
  • 선택된 손실에 대해 250-step PGD를 사용하고 미분 가능 데이터 증강을 적용하여 오염을 제작한다.
  • 각 원천 클래스를 대상 라벨로 매핑하는 클래스-타깃 공격을 탐구하고, 비타깃팅과 타깃팅 성능을 비교한다.
  • CIFAR-10과 ImageNet(공개된 ImageNet-P 포함), 얼굴 인식 설정에서 평가한다.
  • 기존 오염 기준선(TensorClog, Loss Minimization, Alignment 등)과 비교한다.
  • 적대적 학습, 다양한 증강 기법, DPSGD를 포함한 방어를 시험하여 강건성을 평가한다.

실험 결과

연구 질문

  • RQ1고정된 모델에서 제작된 적대적 예제가 가용성 공격에서 기존의 오염 방법보다 더 나은 성능을 보일 수 있는가?
  • RQ2적대적 오염이 잘못된 클래스에 대해 유용한 의미론적 내용을 담아 학습 저하를 효과적으로 유도하는가?
  • RQ3대규모 데이터셋(ImageNet) 및 얼굴 인식 맥락에서 클래스-타깃 적대적 오염은 어떻게 성능에 영향을 주는가?
  • RQ4표준 방어(적대적 학습, 데이터 증강, DPSGD)가 적대적 오염에 대해 효과적인가?

주요 결과

  • 적대적 오염은 CIFAR-10의 다수 아키텍처에서 테스트 정확도를 크게 저하시켜 8/255의 교란에서도 성능을 무력화하거나 무작위 추측 수준에 가깝게 만든다.
  • CIFAR-10에서 8/255 교란의 적대적 오염은 ResNet-18의 검증 정확도를 약 6.25%로 만들며, 기존 방법들(예: Alignment 53.67%, Adversarial Poisoning 6.25%)에 비해 저조하다.
  • ImageNet에서 클래스-타깃 오염은 검증 정확도를 극적으로 감소시키며, 예를 들어 4/255는 45.07%, 8/255는 36.63%, CT 4/255는 3.57%, CT 8/255는 1.45%를 보인다.
  • 얼굴 인식에서 클래스-타깃 오염은 평균 정확도를 8.00%로 줄여 학습 불가 예시(16.00%)보다 우수한 성능을 보인다.
  • 라벨 수정 실험은 제작 네트워크의 잘못된 라벨로 오염된 데이터를 재레이블링하면 상당한 정확도가 회복되며, 전이 가능하지 않는 강건한 특징의 존재를 보여준다.
  • 적대적 학습과 같은 방어가 오염 효과를 완화하지만 자연 정확도에 큰 타격을 주고 계산 비용이 많이 든다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.