Skip to main content
QUICK REVIEW

[논문 리뷰] MultiGuard: Provably Robust Multi-label Classification against Adversarial Examples

Jinyuan Jia, Wenjie Qu|arXiv (Cornell University)|2022. 10. 03.
Adversarial Robustness in Machine Learning인용 수 4
한 줄 요약

MultiGuard는 등방성 가우시안 노이즈를 사용한 랜덤화 스무딩을 통해 다중 레이블 분류에 대한 처음으로 증명 가능하고 강건한 방어 방법이다. $ε$-유계 $l_2$ 적대적 편향 하에서 예측 집합에 유지되는 진정 레이블의 수를 보증하며, VOC 2007, MS-COCO, NUS-WIDE 데이터셋에서 일반화된 다중 클래스 증명 가능 방어 대비 뛰어난 강건성을 확보한다.

ABSTRACT

Multi-label classification, which predicts a set of labels for an input, has many applications. However, multiple recent studies showed that multi-label classification is vulnerable to adversarial examples. In particular, an attacker can manipulate the labels predicted by a multi-label classifier for an input via adding carefully crafted, human-imperceptible perturbation to it. Existing provable defenses for multi-class classification achieve sub-optimal provable robustness guarantees when generalized to multi-label classification. In this work, we propose MultiGuard, the first provably robust defense against adversarial examples to multi-label classification. Our MultiGuard leverages randomized smoothing, which is the state-of-the-art technique to build provably robust classifiers. Specifically, given an arbitrary multi-label classifier, our MultiGuard builds a smoothed multi-label classifier via adding random noise to the input. We consider isotropic Gaussian noise in this work. Our major theoretical contribution is that we show a certain number of ground truth labels of an input are provably in the set of labels predicted by our MultiGuard when the $\ell_2$-norm of the adversarial perturbation added to the input is bounded. Moreover, we design an algorithm to compute our provable robustness guarantees. Empirically, we evaluate our MultiGuard on VOC 2007, MS-COCO, and NUS-WIDE benchmark datasets. Our code is available at: \url{https://github.com/quwenjie/MultiGuard}

연구 동기 및 목표

  • 다중 레이블 분류에 대한 증명 가능 강건 방어의 부재로 인해 여전히 적대적 예제에 취약한 문제를 해결하기 위해.
  • 다중 클래스 강건성에 효과적인 랜덤화 스무딩을 다중 레이블 환경으로 확장하여 레이블 집합 안정성에 대한 공식 보장을 제공하기 위해.
  • 유계 편향 하에서 적어도 $e$개의 진정 레이블이 증명 가능하게 예측됨을 보장하는 인터섹션 크기 $e$를 유도하기 위해.
  • 다중 레이블 환경에서 증명 가능 강건성 보장을 효율적으로 계산하기 위한 알고리즘 설계를 위해.
  • 표준 벤치마크에서 하이퍼파rameter에 따른 MultiGuard의 강건성과 트레이드오프를 실증적으로 검증하기 위해.

제안 방법

  • 입력에 등방성 가우시안 노이즈를 추가하여 스무딩된 다중 레이블 분류기 생성을 통해 랜덤화 스무딩을 활용한다.
  • 레이블 확률 $p_i$—기본 분류기의 상위-$k'$ 예측에 레이블 $i$가 포함될 가능성—을 스무딩의 기초로 사용한다.
  • 최종 출력으로 $p_i$ 값이 가장 높은 $k$개의 레이블을 예측하여 강건한 다중 레이블 예측을 형성한다.
  • 이론적 분석에서 다중 함수에 대한 네이만-피어슨 정리의 새로운 변형을 도입하여 다중 레이블 예측을 다룬다.
  • 제약 조건이 있는 최적화 문제(식 8)를 사용하여 인터섹션 크기 $e$를 유도하며, 레이블 확률의 하한 및 상한을 균형 잡는다.
  • 레이블 확률을 추정하고 강건성 보장을 효율적으로 계산하기 위해 몬테카를로 샘플링 기반 알고리즘을 활용한다.

실험 결과

연구 질문

  • RQ1다중 레이블 분류에서 다수의 레이블이 각 입력에 대해 예측되는 상황에서, 랜덤화 스무딩이 증명 가능 강건성 보장을 제공할 수 있는가?
  • RQ2$l_2$-유계 적대적 편향 하에서 예측 집합에 유지되는 진정 레이블 수에 대한 이론적 한계는 무엇인가?
  • RQ3$k'$, $k$, $\sigma$, $n$, $\alpha$와 같은 하이퍼파rameter가 실질적으로 인터섹션 크기와 강건성에 어떤 영향을 미치는가?
  • RQ4강건성 최적화(식 8)에 이차 항을 포함시키면 인증 성능이 크게 향상되는가?
  • RQ5다중 레이블 벤치마크에서 기존의 증명 가능 방어 대비 MultiGuard의 강건성과 정확도는 어떻게 비교되는가?

주요 결과

  • 식 8의 이차 항을 포함한 경우, VOC 2007에서 $R=0.5$일 때 31.3%의 인증된 top-$k$ 정밀도@$R$를 달성했으며, 이는 이차 항을 포함하지 않은 경우 23.6%보다 높다.
  • 이차 항을 포함함으로써 인증된 top-$k$ 재현율@$R$이 48.8%에서 66.4%로 향상되어 이의 영향력이 뚜렷하게 드러난다.
  • 큰 $k'$는 공격이 없는 경우 성능을 향상시키지만, 공격자가 가능한 편향 공간을 확장함으로써 강건성을 감소시킨다.
  • 큰 $k$는 $R$ 증가에 대한 강건성을 향상시키지만, 공격이 없는 경우 정밀도가 낮아지는 비용을 수반한다.
  • 큰 $\sigma$는 강건성을 향상시키지만 청소된 데이터 성능을 저하시켜 강건성과 정확도 사이의 트레이드오프를 보여준다.
  • 큰 $n$과 $\alpha$는 인증된 인터섹션 크기를 향상시키지만, $n$이 크거나 $\alpha$가 충분히 작아지면 효과가 포화 상태에 도달한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.