Skip to main content
QUICK REVIEW

[논문 리뷰] CapsAttacks: Robust and Imperceptible Adversarial Attacks on Capsule Networks

Alberto Marchisio, Giorgio Nanfa|arXiv (Cornell University)|2019. 01. 28.
Adversarial Robustness in Machine Learning참고 문헌 24인용 수 20
한 줄 요약

이 논문은 GTSRB 데이터셋에서 캡슐 네트워크를 대상으로 하는 타겟 지정, 인지할 수 없는 적대적 예제를 생성하기 위한 탐욕적 블랙박스 알고리즘인 CapsAttacks를 제안한다. 이 방법은 공간적 주의 메커니즘과 기울기 기반 최적화를 활용하여 표준 CNN보다 더 효과적으로 캡슐 네트워크를 속이기 위한 최소한의 변형을 생성한다. 결과적으로 캡슐 네트워크는 강건하지만, 낮은 출력 확률 신뢰도로 인해 취약함을 드러내며, VGGNet는 더 높은 신뢰도 점수로 인해 더 높은 강건성을 보임을 확인한다.

ABSTRACT

Capsule Networks preserve the hierarchical spatial relationships between objects, and thereby bears a potential to surpass the performance of traditional Convolutional Neural Networks (CNNs) in performing tasks like image classification. A large body of work has explored adversarial examples for CNNs, but their effectiveness on Capsule Networks has not yet been well studied. In our work, we perform an analysis to study the vulnerabilities in Capsule Networks to adversarial attacks. These perturbations, added to the test inputs, are small and imperceptible to humans, but can fool the network to mispredict. We propose a greedy algorithm to automatically generate targeted imperceptible adversarial examples in a black-box attack scenario. We show that this kind of attacks, when applied to the German Traffic Sign Recognition Benchmark (GTSRB), mislead Capsule Networks. Moreover, we apply the same kind of adversarial attacks to a 5-layer CNN and a 9-layer CNN, and analyze the outcome, compared to the Capsule Networks to study differences in their behavior.

연구 동기 및 목표

  • 자율 주행과 같은 안전이 중요한 애플리케이션에서 캡슐 네트워크의 적대적 공격에 대한 취약성을 조사하기 위해.
  • 적대적 변형이 가해진 상황에서 표준 CNNs(5층의 LeNet 및 9층의 VGGNet)와의 캡슐 네트워크의 강건성 비교를 위해.
  • 블랙박스 환경에서 효과적인 자동화된 타겟 지정 및 인지할 수 없는 적대적 공격 방법을 개발하기 위해.
  • 예측 신뢰도와 공간적 주의가 다양한 아키텍처 간의 적대적 강건성에 미치는 영향을 분석하기 위해.

제안 방법

  • 제안된 CapsAttacks 알고리즘은 모델의 출력에서 기울기 정보를 활용하여 블랙박스 환경에서 타겟 지정 적대적 예제를 생성하기 위한 탐욕적 최적화 전략을 사용한다.
  • 시각적 왜곡을 제어하기 위해 최대 허용 변형 거리 $ D_{\text{MAX}} $ 를 사용하는 거리 기반 제약 조건을 적용하여 변형이 인지할 수 없도록 보장한다.
  • 모델의 결정 경계의 미분 가능 근사치를 사용하여 입력 픽셀을 반복적으로 수정함으로써, 타겟 클래스에 대한 손실을 최대화하면서 시각적 변화를 최소화한다.
  • 알고리즘은 모델의 타겟 클래스에 대한 예측 확률이 임계값을 초과하는지 여부에 따라 적대적 성공 여부를 평가하며, 수렴 속도와 변형 크기를 기반으로 성공도를 측정한다.
  • 동일한 공격 조건에서 CapsNet, LeNet, VGGNet의 행동을 비교하여 출력 확률 이동과 변형 민감도를 분석한다.
  • 실제 도로 신호등 이미지를 사용하여 실생활에서의 강건성을 평가하기 위해 독일 교통 신호 인식 벤치마크(GTSRB)에서 프레임워크를 평가한다.

실험 결과

연구 질문

  • RQ1캡슐 네트워크는 블랙박스 환경에서 타겟 지정, 인지할 수 없는 적대적 공격에 취약한가?
  • RQ2동일한 적대적 공격 조건에서 캡슐 네트워크의 강건성은 표준 CNNs(예: LeNet 및 VGGNet)와 비교해 어떻게 다를까?
  • RQ3예측 신뢰도는 신경망이 적대적 예제에 취약한 정도를 결정하는 데 어떤 역할을 하는가?
  • RQ4애핀 변환과 입력 수준의 변형은 캡슐 네트워크와 CNN 간의 강건성에 어떤 영향을 미치는가?
  • RQ5탐욕적이고 기울기 기반의 알고리즘이 다양한 아키텍처에서 모두 효과적이고 인지할 수 없으면서도 강건한 적대적 예제를 생성할 수 있는가?

주요 결과

  • 캡슐 네트워크는 타겟 지정, 인지할 수 없는 적대적 공격에 취약하며, 제안된 CapsAttacks 알고리즘이 GTSRB 데이터셋에서 오염된 예제를 성공적으로 생성했다.
  • CapsNet은 VGGNet보다 이미지를 잘못 분류하기 위해 더 적은 반복 수를 필요로 하여, 낮은 시각적 인지 가능성에도 불구하고 더 높은 취약성을 보였다.
  • VGGNet은 더 높은 출력 확률 신뢰도로 인해 CapsNet보다 더 높은 강건성을 보였으며, 진짜 클래스와 타겟 클래스의 확률 간 격차가 더 컸다.
  • LeNet은 세 모델 중에서 가장 취약했으며, 타겟 이미지를 잘못 분류하기 위해 단 6회의 반복만으로도 성공했고, 13회 반복 후에는 변형이 인지 가능해졌다.
  • VGGNet의 경우 CapsNet보다 $ D(X^*, X) $ 값이 더 급격히 증가했으며, 이는 시각적 왜곡이 VGGNet에서 더 빠르게 누적됨을 의미한다. 즉, VGGNet의 적대적 예제는 더 눈에 띈다.
  • 유사한 정확도를 보였음에도 불구하고, CapsNet은 VGGNet보다 더 낮은 출력 확률 신뢰도를 보였으며, 이는 작은 변형에 더 민감한 이유가 되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.