Skip to main content
QUICK REVIEW

[논문 리뷰] Intrinsic Certified Robustness of Bagging against Data Poisoning Attacks

Jinyuan Jia, Xiaoyu Cao|arXiv (Cornell University)|2020. 08. 11.
Adversarial Robustness in Machine Learning인용 수 15
한 줄 요약

이 논문은 데이터 풀링 공격에 대해 부트스트랩 앙상블(bootstrapping ensemble)의 내재적 인증 가능 안정성을 제안하며, 기반 학습 알고리즘에 관계없이 테스트 예측이 일관하게 유지됨을 증명한다. 이는 훈련 데이터에 손상된 예시(수정, 삭제, 삽입)가 유도된 임계값 이하일 경우에 해당한다. 이 방법은 MNIST에서 최대 100개의 오염된 예시가 존재할 경우 91.1%의 인증 정확도를 달성하며, 기존의 인증 방어 기법들보다 안정성과 효율성 측면에서 뛰어나다.

ABSTRACT

In a \emph{data poisoning attack}, an attacker modifies, deletes, and/or inserts some training examples to corrupt the learnt machine learning model. \emph{Bootstrap Aggregating (bagging)} is a well-known ensemble learning method, which trains multiple base models on random subsamples of a training dataset using a base learning algorithm and uses majority vote to predict labels of testing examples. We prove the intrinsic certified robustness of bagging against data poisoning attacks. Specifically, we show that bagging with an arbitrary base learning algorithm provably predicts the same label for a testing example when the number of modified, deleted, and/or inserted training examples is bounded by a threshold. Moreover, we show that our derived threshold is tight if no assumptions on the base learning algorithm are made. We evaluate our method on MNIST and CIFAR10. For instance, our method achieves a certified accuracy of $91.1\%$ on MNIST when arbitrarily modifying, deleting, and/or inserting 100 training examples. Code is available at: \url{https://github.com/jjy1994/BaggingCertifyDataPoisoning}.

연구 동기 및 목표

  • 기존의 인증 방어 기법들이 적용 범위가 제한되거나 안정성 보장가가 느슨한 점을 해결하기 위해.
  • 기반 학습 알고리즘에 대한 가정 없이 부트스트랩 앙상블이 본질적으로 데이터 풀링 공격에 대해 인증 가능 안정성을 제공한다는 것을 증명하기 위해.
  • 주어진 테스트 입력에 대해 레이블 일관성을 유지하는 데 필요한 오염된 훈련 예시의 수에 대한 엄밀한 상한을 유도하기 위해.
  • 실제 구현을 위해 레이블 확률을 추정하고 오염 크기를 인증하기 위한 효율적인 몬테카를로 기반 알고리즘을 개발하기 위해.
  • MNIST와 CIFAR10에서의 실험적 검증을 통해 기존 방법들에 비해 뛰어난 인증 정확도와 효율성을 입증하기 위해.

제안 방법

  • 이 방법은 부트스트랩 앙상블(Bootstrap Aggregating, bagging)을 활용하여, 교체를 허용한 훈련 데이터의 무작위 부분집합에 대해 다수의 기반 분류기 모델을 훈련한다.
  • 각 테스트 예측에 대해 앙상블 분류기는 기반 모델들 간의 예측 레이블 확률 중 가장 높은 값을 기반으로 레이블을 예측한다.
  • 인증된 오염 크기는 앙상블가 예측한 가장 큰 레이블 확률과 두 번째로 큰 레이블 확률을 포함하는 최적화 문제의 해로 유도된다.
  • 몬테카를로 알고리즘은 N개의 무작위로 선택된 부분집합과 N개의 훈련된 기반 분류기를 사용하여 가장 큰 레이블 확률에 대한 하한을 추정하고, 두 번째로 큰 레이블 확률에 대한 상한을 추정한다.
  • 추정된 경계를 사용하여 최적화 문제를 효율적으로 해결함으로써 각 테스트 예측에 대해 인증된 오염 크기를 계산한다.
  • 이 방법은 MNIST와 CIFAR10에서 평가되었으며, 재현 가능성을 위해 코드가 공개되었다.

실험 결과

연구 질문

  • RQ1부트스트랩 앙상블이 수정, 삭제, 삽입을 포함한 훈련 예시 오염 공격에 대해 공식적으로 인증 가능 안정성을 지닌다고 증명할 수 있는가?
  • RQ2기반 학습 알고리즘에 대한 가정 없이 유도된 인증 오염 크기가 타당한가?
  • RQ3실제로 필요한 레이블 확률을 추정하고 인증 오염 크기를 계산하기 위해 효율적이고 확장 가능한 알고리즘이 가능한가?
  • RQ4기존의 인증 방어 기법들과 비교했을 때 부트스트랩 앙상블의 인증 안정성은 정확도와 효율성 측면에서 어떻게 다른가?
  • RQ5실제 오염 시나리오에서 MNIST와 CIFAR10과 같은 다양한 데이터셋에서 이 방법이 강력한 안정성을 유지하는가?

주요 결과

  • 부트스트랩 앙상블은 오염된 훈련 예시 수가 유도된 임계값 이하일 경우, 테스트 예측에 대해 일관된 예측을 유지함으로써 내재적 인증 가능 안정성을 제공한다.
  • 유도된 인증 오염 크기는 타당하며, 기반 학습 알고리즘에 대한 가정 없이 더 큰 상한을 보장할 수 없다.
  • MNIST 데이터셋에서, 최대 100개의 훈련 예시가 임의로 수정, 삭제, 삽입되어도 이 방법은 91.1%의 인증 정확도를 달성한다.
  • 특히 삽입 및 삭제를 포함한 오염 시나리오에서, 기존의 인증 방어 기법들보다 안정성과 계산 효율성 측면에서 뛰어나다.
  • 몬테카를로 기반 추정 알고리즘은 높은 정확도로 다수의 테스트 예측에 대해 인증 오염 크기를 확장 가능하게 계산할 수 있도록 한다.
  • 이 방법은 모든 기반 학습 알고리즘에 일반적으로 적용 가능하므로, 실세계의 머신러닝 시스템에 널리 활용 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.