Skip to main content
QUICK REVIEW

[논문 리뷰] Voting based ensemble improves robustness of defensive models

Devvrit Devvrit, Minhao Cheng|arXiv (Cornell University)|2020. 11. 28.
Adversarial Robustness in Machine Learning참고 문헌 42인용 수 12
한 줄 요약

이 논문은 하드 레이블 다수결 투표를 통해 사전 훈련된 다양한 방어 모델을 조합함으로써, 추가 데이터 없이 ℓ∞ 노이즈가 8/255인 CIFAR-10에서 59.8%의 최고 수준의 강건성 정확도를 달성하는 투표 기반 앙상블 방법을 제안한다. 이는 적대적 훈련된 모델의 강건성을 크게 향상시킨다.

ABSTRACT

Developing robust models against adversarial perturbations has been an active area of research and many algorithms have been proposed to train individual robust models. Taking these pretrained robust models, we aim to study whether it is possible to create an ensemble to further improve robustness. Several previous attempts tackled this problem by ensembling the soft-label prediction and have been proved vulnerable based on the latest attack methods. In this paper, we show that if the robust training loss is diverse enough, a simple hard-label based voting ensemble can boost the robust error over each individual model. Furthermore, given a pool of robust models, we develop a principled way to select which models to ensemble. Finally, to verify the improved robustness, we conduct extensive experiments to study how to attack a voting-based ensemble and develop several new white-box attacks. On CIFAR-10 dataset, by ensembling several state-of-the-art pre-trained defense models, our method can achieve a 59.8% robust accuracy, outperforming all the existing defensive models without using additional data.

연구 동기 및 목표

  • 사전 훈련된 강건 모델의 앙상블이 개별 모델을 초월해 적대적 강건성을 추가로 향상시킬 수 있는지 조사하는 것.
  • 특히 강력한 화이트박스 공격 상황에서 효과적인 앙상블 전략의 부족을 해결하는 것.
  • 최적의 모델 조합을 선택하여 높은 성능을 보이는 앙성스를 구성하기 위한 원칙적인 방법을 개발하는 것.
  • 기존 및 새로 개발된 화이트박스 공격에 대해 투표 기반 앙성스의 강건성을 평가하는 것.

제안 방법

  • 소프트 레이블 융합이나 로짓 평균화 대신, 여러 사전 훈련된 강건 모델 간에 하드 레이블 다수결 투표를 사용한다.
  • 실험적으로 기본 모델의 손실 곡면에서의 다양성이 앙상블 성공에 핵심적임을 검증한다.
  • 작은 데이터 부분집합에서의 적대적 공격 성능을 기반으로 후보 앙성스를 순위 매기는 모델 선택 알고리즘을 제안한다.
  • 강력한 공격(예: WA-autoattack, WA-FAB) 하에서의 적대적 정확도를 바탕으로 풀에서 7개 모델 중 최상의 3개를 선별하는 히우리스틱 점수를 활용한다.
  • 투표 기반 앙성스를 공격하기 위한 새로운 화이트박스 공격 기법(예: C&W over 2, LS-autoattack)을 도입하여 강건성을 철저히 시험한다.
  • 계산 비용을 최소화하면서도 예측 능력을 유지하기 위해, 랜덤 부분집합(r ≈ 4500점)을 사용해 앙성스를 평가하고 순위를 매긴다.

실험 결과

연구 질문

  • RQ1사전 훈련된 강건 모델의 투표 기반 앙성스가 개별 모델보다 더 높은 강건성 정확도를 달성할 수 있는가?
  • RQ2특히 적대적 공격 맥락에서 앙성스의 성공을 결정짓는 요소는 무엇인가?
  • RQ3풀에서 최적의 모델 조합을 자동으로 선택하여 앙성스의 강건성을 극대화할 수 있는가?
  • RQ4기존 및 새로 개발된 화이트박스 공격은 투표 기반 앙성스에 얼마나 효과적인가?

주요 결과

  • 투표 기반 앙성스는 ℓ∞ 노이즈가 8/255인 CIFAR-10에서 59.8%의 강건성 정확도를 달성하며, 추가 데이터 없이도 모든 개별 모델과 이전의 방어 방법을 능가한다.
  • MART, TRADES+SAT, TRADES-AWP로 구성된 최고의 앙성스는 WA-autoattack 하에서 59.84%의 정확도를 기록했으며, WA-FAB 하에서도 동일한 59.84%를 달성하여 강력한 강건성을 입증한다.
  • 모델 선택 알고리즘이 WA-autoattack 및 WA-FAB에 대해 각각 페어슨 상관계수 τ = +0.53 및 +0.503을 기록하여, 예측 점수와 실제 강건성 간에 중간 정도의 정적 상관관계를 보였다.
  • 가장 강건하지 않은 6개 모델(가장 강건한 TRADES-AWP 제외)로 구성된 앙성스는 최고의 기본 모델(54.86%)에서 59.2%로 강건성 정확도가 향상되어 4.34% 향상되었으며, 이는 다양성의 가치를 입증한다.
  • 제안된 앙성스는 LS-autoattack 및 C&W over 2와 같은 여러 강력한 공격에 대해도 강건성을 유지하여, 적응형 화이트박스 공격에 대한 저항성을 확인한다.
  • 이 연구는 소프트 레이블 융합 방법이 강력한 공격에서 실패하는 반면, 다양한 손실 곡면을 가진 하드 레이블 투표가 더 강건한 대안임을 드러낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.