Skip to main content
QUICK REVIEW

[논문 리뷰] Automated Discovery of Adaptive Attacks on Adversarial Defenses

Chengyuan Yao, Pavol Bielik|arXiv (Cornell University)|2021. 02. 23.
Adversarial Robustness in Machine Learning참고 문헌 48인용 수 4
한 줄 요약

이 논문은 재사용 가능한 공격 구성 요소—예: 알고리즘, 네트워크 변환, 손실 함수—의 형식화된 공간을 탐색함으로써 강력하고 방어에 특화된 적응형 공격을 자동으로 발견하는 A3(Adaptive AutoAttack)이라는 자동화된 프레임워크를 제안한다. 이는 24개 방어 중 10개에 대해 AutoAttack보다 3.0%~50.8% 더 많은 적응형 예제를 발견하여, 수동적 노력 감소와 함께 강건성 평가의 신뢰성을 크게 향상시킨다.

ABSTRACT

Reliable evaluation of adversarial defenses is a challenging task, currently limited to an expert who manually crafts attacks that exploit the defense's inner workings or approaches based on an ensemble of fixed attacks, none of which may be effective for the specific defense at hand. Our key observation is that adaptive attacks are composed of reusable building blocks that can be formalized in a search space and used to automatically discover attacks for unknown defenses. We evaluated our approach on 24 adversarial defenses and show that it outperforms AutoAttack, the current state-of-the-art tool for reliable evaluation of adversarial defenses: our tool discovered significantly stronger attacks by producing 3.0\%-50.8\% additional adversarial examples for 10 models, while obtaining attacks with slightly stronger or similar strength for the remaining models.

연구 동기 및 목표

  • 적응형 방어의 평가가 불신뢰스러운 문제를 해결하기 위해, 일반적으로 강력하고 맞춤형 공격이 부족하기 때문이다.
  • 방어에 특화된 취약점을 악용하는 적응형 공격를 수작업으로 만드는 데 전문가의 참여가 많고 수고스러운 과정을 자동화하기 위해이다.
  • 알고리즘, 손실 함수, 네트워크 변환과 같은 재사용 가능한 공격 구성 요소를 형식화된 검색 공간으로 정의하여 자동 공격 발견을 가능하게 하기 위해이다.
  • 개별 방어에 맞춤화된 공격을 발견함으로써 적응형 강건성 평가의 신뢰성과 강도를 향상시키기 위해이다.
  • 공격 개발 시 시도 오류의 부담을 줄이면서도 인간 전문가가 새로운 공격 유형을 고안할 수 있는 능력을 유지하기 위해이다.

제안 방법

  • 이 방법은 세 가지 핵심 구성 요소로 이루어진 검색 공간을 정의한다: 공격 알고리즘(예: PGD, APGD, FAB), 네트워크 변환(예: BPDA, 레이어 제거), 손실 함수(예: 교차 엔트로피, DLR, C&W).
  • 공격 발견 과제를 이 검색 공간 위에서 최적화 문제로 공식화하며, 각 구성 설정은 후보 적응형 공격를 나타낸다.
  • 검색은 효율적인 공격 구성 요소 조합 탐색을 위해 베이지안 최적화나 조기 정지 기법을 활용하는 알고리즘에 의해 이끌린다. 이는 효과성과 비용의 균형을 맞추기 위함이다.
  • 프레임워크는 하이퍼파rameter(예: 스텝 크기, 스텝 수)의 동적 적응을 지원하며, EOT(변환에 대한 기대값) 및 랜덤화 기법을 통합하여 공격 성공률을 향상시킨다.
  • 정의된 공간 내에서 가장 강력한 공격을 찾는 데 자동으로 방어를 테스트할 수 있도록 구현된 도구로, Adaptive AutoAttack(A3)를 이름 붙였다.
  • 이 접근법은 확장 가능하다: 전문가가 새로운 공격 구성 요소를 추가함으로써 검색 공간을 확장할 수 있으며, 이는 시스템 재설계 없이도 가능하다.

실험 결과

연구 질문

  • RQ1기존의 고정된 앙상블 방법인 AutoAttack에 비해 체계적이고 자동화된 접근 방식이 더 강력한 적응형 공격을 발견할 수 있는가?
  • RQ2알고리즘, 손실 함수, 네트워크 변환과 같은 재사용 가능한 공격 구성 요소를 효과적인 공격 발견을 가능하게 하는 검색 공간으로 형식화할 수 있는가?
  • RQ3자동화된 검색이 수동으로 전문가가 만든 적응형 공격에 비해 공격 성공률 측면에서 어느 정도 뛰어나게 성능을 발휘할 수 있는가?
  • RQ4다양한 방어 메커니즘을 가진 다양한 적응형 방어에 대해 자동화된 도구의 성능은 어떻게 비교되는가?
  • RQ5검색 공간에 명시적으로 포함되지 않은 경우에도 검색 과정이 알려진 적응형 공격를 재발견하거나 개선할 수 있는가?

주요 결과

  • A3는 평가된 24개 방어 중 10개에 대해 AutoAttack보다 훨씬 강력한 공격을 발견하여, 3.0%에서 50.8%까지 더 많은 적응형 예제를 생성했다.
  • 남은 14개의 방어에 대해서는 A3가 AutoAttack과 비슷하거나 略적으로 더 나은 공격 강도를 달성하여, 다양한 종류의 방어에 대해 안정성을 입증했다.
  • 검색 공간에 명시적으로 포함되지 않은 수작업으로 만든 적응형 공격를 성공적으로 재발견하거나 개선했으며, 일반화 능력을 입증했다.
  • 검색 공간 설계 덕분에 동적 스텝 크기, 수정된 손실 함수, 서로서티 모델 변환과 같은 공격 설정 탐색이 효과적으로 가능했다.
  • 이 프레임워크는 공격 개발 시 수작업 시도 오류의 필요성을 줄여주며, 전문가가 구성 조정보다는 혁신에 집중할 수 있도록 했다.
  • 성공에도 불구하고 검색 공간은 아직 완전하지 않으며, 런타임 모델링 부족으로 인해 비용이 많이 드는 공격는 높은 계산 비용을 초래할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.