Skip to main content
QUICK REVIEW

[논문 리뷰] Deflecting Adversarial Attacks

Yao Qin, Nicholas Frosst|arXiv (Cornell University)|2020. 02. 18.
Adversarial Robustness in Machine Learning참고 문헌 25인용 수 15
한 줄 요약

이 논문은 캡슐 네트워크와 사이클 일致성 손실을 활용하여 적대적 예제가 시각적으로 타깃 클래스와 유사하게 만들기 위해 '적대적 공격을 방향 전환하는' 새로운 방어 전략을 제안한다. 이로 인해 인간의 인지에서 적대적 예제가 더 이상 적대적이지 않게 된다. 이 방법은 표준 공격과 방어 인지 공격 모두에 대해 최신 기술 수준의 탐지 성능을 달성하며, SVHN에서 탐지되지 않은 블랙박스 공격의 69.7%를 방향 전환한다. 인간 레이블링 연구를 통해 이를 검증하였다.

ABSTRACT

There has been an ongoing cycle where stronger defenses against adversarial attacks are subsequently broken by a more advanced defense-aware attack. We present a new approach towards ending this cycle where we "deflect'' adversarial attacks by causing the attacker to produce an input that semantically resembles the attack's target class. To this end, we first propose a stronger defense based on Capsule Networks that combines three detection mechanisms to achieve state-of-the-art detection performance on both standard and defense-aware attacks. We then show that undetected attacks against our defense often perceptually resemble the adversarial target class by performing a human study where participants are asked to label images produced by the attack. These attack images can no longer be called "adversarial'' because our network classifies them the same way as humans do.

연구 동기 및 목표

  • 적대적 공격-방어-다시 공격의 반복적 사이클을 해결하기 위해, 적대적 예제를 인간의 시각 인지에서 타깃 클래스와 구별되지 않게 만드는 새로운 방어 전략을 제안한다.
  • 표준 공격과 방어 인지 공격 모두에 강건한 탐지 메커니즘을 개발한다.
  • 탐지되지 않은 적대적 공격이 더 이상 진정으로 '적대적'이 아니라는 것을 입증하기 위해, 인간이 이러한 공격을 타깃 클래스로 분류한다는 것을 보여준다.
  • 탐지 메커니즘을 특별히 공격하기 위해 방어 인지 공격을 설계하여, 제안된 탐지 메커니즘의 강건성을 철저히 테스트한다.

제안 방법

  • 승리 캡슐 재구성과 원본 입력의 클래스 조건부 분포가 일치하도록 강제하는 사이클 일치성 손실을 도입하여, 탐지 및 방향 전환 성능을 향상시킨다.
  • 두 개의 스트림 아키텍처를 활용: 캡슐 분류 네트워크와 캡슐 포즈 파rameter에 조건부로 설정된 재구성 네트워크.
  • 재구성 불일치, 주의 기반 탐지, 사이클 일치성 손실의 세 가지 탐지 메커니즘을 조합하여 강건성을 향상시킨다.
  • 청결한 입력과 적대적 입력의 재구성 간 격리에 기반한 두 가지 공격 무관 탐지 방법을 제안한다.
  • 탐지 메커니즘을 특별히 공격하기 위해 방어 인지 공격을 설계하여, 그 내구성을 시험한다.
  • 아마존 메카니컬 터크를 통한 인간 연구를 통해, 탐지되지 않은 적대적 예제가 시각적으로 타깃 클래스와 얼마나 일치하는지 평가한다.

실험 결과

연구 질문

  • RQ1적대적 공격이 타깃 클래스와 시각적으로 유사하게 만들어져 인간의 인지에서 더 이상 적대적이지 않게 방향 전환될 수 있는가?
  • RQ2제안된 사이클 일치성 손실이 캡슐 네트워크에서 적대적 공격의 탐지 및 방향 전환 성능을 향상시키는가?
  • RQ3SVHN과 CIFAR-10에서 표준 공격과 방어 인지 공격에 대해 탐지 메커니즘이 얼마나 효과적인가?
  • RQ4탐지되지 않은 적대적 공격이 모델에 대해 인간 평가자에게 타깃 클래스처럼 보이는 정도는 어느 정도인가?
  • RQ5방어 인지 공격이 탐지 메커니즘을 성공적으로 우회할 수 있었는가? 만약 그렇다면, 모델은 여전히 높은 수준의 방향 전환을 달성할 수 있었는가?

주요 결과

  • SVHN 데이터셋에서 탐지되지 않은 블랙박스 PGD 공격의 69.7%가 인간 평가자에 의해 타깃 클래스로 분류되었으며, 이는 성공적인 방향 전환을 의미한다.
  • 탐지 메커니즘은 SVHN과 CIFAR-10 양쪽에서 최신 기술 수준의 성능을 달성하여, 이전 방법보다 방어 인지 공격에 대해 뛰어난 성능을 보였다.
  • 방어 인지 공격은 탐지를 회피하는 적대적 예제를 생성할 수 있었지만, 이러한 예제들은 여전히 타깃 클래스와 시각적으로 유사하게 보였다.
  • CIFAR-10에서는 SVHN만큼 공격이 일관되게 방향 전환되지는 않았지만, 여전히 원본 입력보다는 타깃 클래스와 더 유사하게 보였다.
  • 사이클 일치성 손실은 모델이 클래스 조건부 분포를 재구성하는 능력을 크게 향상시켜 탐지 및 방향 전환 능력을 강화했다.
  • 인간 연구를 통해 기준 CNN 모델에 대한 공격에서는 타깃 클래스와 유사한 시각적 일치가 관찰되지 않았으며, 이는 방향 전환 효과의 고유성을 검증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.