Skip to main content
QUICK REVIEW

[논문 리뷰] Query-Efficient and Scalable Black-Box Adversarial Attacks on Discrete Sequential Data via Bayesian Optimization

Deok‐Sun Lee, Seungyong Moon|arXiv (Cornell University)|2022. 06. 17.
Adversarial Robustness in Machine Learning인용 수 11
한 줄 요약

이 논문은 블록 분해, 이력 서브샘플링 및 후처리 최적화를 통해 NLP 및 단백질 분류 작업에서 더 적은 쿼리와 낮은 수정률로 상태의 최고 성능을 달성하는 쿼리 효율적인 블랙박스 적대적 공격을 제안한다. BBA는 자동 관련성 결정(ARD) 카테고리 커널을 사용한 베이지안 최적화를 이용해 중요도를 동적으로 식별하는 데에 블록웨이즈 베이지안 어택(BBA)을 제안한다.

ABSTRACT

We focus on the problem of adversarial attacks against models on discrete sequential data in the black-box setting where the attacker aims to craft adversarial examples with limited query access to the victim model. Existing black-box attacks, mostly based on greedy algorithms, find adversarial examples using pre-computed key positions to perturb, which severely limits the search space and might result in suboptimal solutions. To this end, we propose a query-efficient black-box attack using Bayesian optimization, which dynamically computes important positions using an automatic relevance determination (ARD) categorical kernel. We introduce block decomposition and history subsampling techniques to improve the scalability of Bayesian optimization when an input sequence becomes long. Moreover, we develop a post-optimization algorithm that finds adversarial examples with smaller perturbation size. Experiments on natural language and protein classification tasks demonstrate that our method consistently achieves higher attack success rate with significant reduction in query count and modification rate compared to the previous state-of-the-art methods.

연구 동기 및 목표

  • 이른바 그레디 블랙박스 공격의 한계를 해결하기 위해 이산 순차 데이터에서 검색 공간이 제한되고 최적 결과를 도출하지 못하는 문제를 해결한다.
  • 긴 시퀀스에 대한 블랙박스 적대적 공격에서 쿼리 효율성과 확장성을 향상시키며, 특히 이산적이고 고차원적인 공간에서 성능을 개선한다.
  • 쿼리 이력과 의미적 유사도를 기반으로 변형을 위한 중요한 위치를 동적으로 식별하는 방법을 개발한다.
  • 공격 성공률을 훼손하지 않으면서도 변형 크기를 줄이기 위해 후처리 최적화 알고리즘을 구현한다.
  • 텍스트와 단백질 시퀀스를 포함한 다양한 도메인으로의 일반화 능력을 입증한다.

제안 방법

  • 쿼리 피드백을 기반으로 각 카테고리 변수(예: 단어 또는 아미노산)의 중요도를 자동으로 학습하기 위해 베이지안 최적화에 ARD 카테고리 커널을 도입한다.
  • 긴 시퀀스를 다룰 수 있는 블록으로 분할하여 고차원 입력 공간에서의 확장 가능한 최적화를 가능하게 한다.
  • 가우스 프로세스 추론의 계산 비용을 줄이면서도 최적화 정확도를 유지하기 위해 이력 서브샘플링을 적용한다.
  • 다양하고 정보적인 시퀀스를 병렬 평가를 위해 선택하기 위해 DPP 기반 배치 업데이트 전략을 사용한다. 이는 쿼리 효율성을 향상시킨다.
  • 공격 성공률을 유지하면서도 변형 크기를 최소화하기 위해 후처리 최적화 알고리즘을 구현한다.
  • 의미적 유사도를 기반으로 공격 공간을 정의한다. 텍스트의 경우 WordNet을, 단백질의 경우 실험적 교환 가능성(ExEx)을 사용하여 의미 있는 동의어 집합을 구성한다.

실험 결과

연구 질문

  • RQ1베이지안 최적화에 ARD 카테고리 커널를 적용할 경우, 이른바 그레디 방법에 비해 이산 순차 데이터에서 쿼리 효율성과 공격 성공률에서 뛰어난 성능을 보일 수 있는가?
  • RQ2블록 분해와 이력 서브샘플링은 긴 시퀀스 공격에서 확장성과 성능에 어떤 영향을 미치는가?
  • RQ3DPP 기반 배치 업데이트 전략은 그레디 배치 선택에 비해 얼마나 쿼리 효율성을 향상시키는가?
  • RQ4후처리 최적화를 통해 변형 크기를 줄일 수 있는가, 이는 공격 성공률을 떨어뜨리지 않는 조건에서 가능한가?
  • RQ5제안된 방법은 NLP 및 단백질 시퀀스 분류와 같은 다양한 도메인으로 일반화 가능한가?

주요 결과

  • EC50 단백질 분류에서 BBA는 평균 231회의 쿼리와 2.0%의 수정률로 99.8%의 공격 성공률을 달성하여 기준 방법들을 능가한다.
  • Yelp 감성 분류의 BERT-base에서 BBA는 14.0%의 수정률과 154회의 평균 쿼리로 77.4%의 공격 성공률을 기록하며, PWWS에 비해 수정률(MR)과 쿼리 수(Qrs)를 크게 감소시켰다.
  • 절단 실험에서 DPP 기반 배치 업데이트 전략은 그레디 배치 선택 대비 공격 성공률을 향상시키고 쿼리 수를 최대 15%까지 줄였다.
  • AG’s News에서 BBA는 500개의 텍스트 중 363개를 오염시키며 14.0%의 MR과 154회의 쿼리로 작동했고, PWWS는 267개를 오염시키며 18.3%의 MR과 367회의 쿼리로 작동했다.
  • BERT-large 및 XLNet-large 모델에서 BBA는 모든 메트릭에서 뛰어난 성능을 유지하여 다양한 모델 아키텍처에서의 강건성을 확인했다.
  • 후처리 최적화를 통해 성공적으로 공격한 예시에서 변형 크기를 줄였으며, BERT-base(AG’s News)에서 BBA는 14.0%의 MR을 기록했고, 동일한 서브셋에서 PWWS는 18.3%의 MR을 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.