Skip to main content
QUICK REVIEW

[논문 리뷰] Effective and Imperceptible Adversarial Textual Attack via Multi-objectivization

Shengcai Liu, Ning Lü|arXiv (Cornell University)|2021. 11. 02.
Adversarial Robustness in Machine Learning참고 문헌 46인용 수 5
한 줄 요약

이 논문은 공격 성공률과 인지 불가능성을 균형 잡는 이중 목적 최적화 문제로 악성 텍스트 공격을 설정하는 다목적 유전적 알고리즘인 HydraText를 제안한다. 인지 불가능성을 주요 목적함수로 통합함으로써, HydraText는 기존 방법보다 더 자연스럽고 인간이 작성한 텍스트처럼 보이는 악성 예제를 생성하며, 점수 기반 및 결정 기반 설정 모두에서 경쟁 가능한 공격 성공률을 달성한다. 이는 자연스러움과 침투성 측면에서 기존 방법을 능가한다.

ABSTRACT

The field of adversarial textual attack has significantly grown over the last few years, where the commonly considered objective is to craft adversarial examples (AEs) that can successfully fool the target model. However, the imperceptibility of attacks, which is also essential for practical attackers, is often left out by previous studies. In consequence, the crafted AEs tend to have obvious structural and semantic differences from the original human-written text, making them easily perceptible. In this work, we advocate leveraging multi-objectivization to address such issue. Specifically, we reformulate the problem of crafting AEs as a multi-objective optimization problem, where the attack imperceptibility is considered as an auxiliary objective. Then, we propose a simple yet effective evolutionary algorithm, dubbed HydraText, to solve this problem. To the best of our knowledge, HydraText is currently the only approach that can be effectively applied to both score-based and decision-based attack settings. Exhaustive experiments involving 44237 instances demonstrate that HydraText consistently achieves competitive attack success rates and better attack imperceptibility than the recently proposed attack approaches. A human evaluation study also shows that the AEs crafted by HydraText are more indistinguishable from human-written text. Finally, these AEs exhibit good transferability and can bring notable robustness improvement to the target model by adversarial training.

연구 동기 및 목표

  • 기존의 악성 텍스트 공격 방법들이 자주 자연스럽거나 문법적으로 잘못된 변형을 생성함에 따라, 인지 불가능성의 부족을 해결한다.
  • 악성 공격 생성을 다목적 최적화 문제로 재정의하여 공격 성공률을 극대화하고 인지 불가능성을 동시에 최소화한다.
  • 실제 운영 환경에서 흔한 점수 기반 및 결정 기반 블랙박스 공격 설정에 모두 적용 가능한 통합 프레임워크를 개발한다.
  • 원본 텍스트와 의미적·문법적으로 유사하게 유지되도록 하여 악성 예제의 현실성과 자연스러움을 향상시킨다.
  • 고품질의 이식 가능 변형을 생성함으로써 악성 예제를 강건성 평가 및 악성 훈련에 활용할 수 있도록 한다.

제안 방법

  • 공격 성공률(최대화)과 인지 불가능성(최대화)이라는 두 개의 목적을 가진 다목적 최적화 문제로 악성 공격 생성을 재정의한다.
  • 문법성과 의미 일관성을 유지하면서 단어 치환의 탐색 공간을 탐색할 수 있는 새로운 유전적 알고리즘인 HydraText를 사용한다.
  • 점수 기반 설정에서는 공격 성공 목적을 모델이 대상 레이블을 예측할 때의 신뢰도로 정의하고, 결정 기반 설정에서는 대상 레이블이 달성된 경우 무한 보상으로 정의한다.
  • 문장 수준의 유사도 측정 지표(예: BLEU, BERTScore)를 사용하여 인지 불가능성 목적을 정의함으로써, 악성 예제가 원본 텍스트와 의미 및 구조적으로 유사하게 유지되도록 보장한다.
  • 비지배적 정렬 기법을 활용하여 두 목적 모두에서 높은 품질의 해를 다양하게 유지하며, 효과적이고 자연스러운 해를 우선시한다.
  • 목적 함수를 적절히 조정함으로써 점수 기반 및 결정 기반 설정 모두를 지원하여, 모델 기울기 정보가 필요 없이도 광범위한 적용 가능성을 확보한다.

실험 결과

연구 질문

  • RQ1다목적 최적화가 악성 텍스트 공격에서 공격 성공률과 인지 불가능성을 효과적으로 균형 잡는 데에 적합한가?
  • RQ2다양한 NLP 모델에서 HydraText는 기존 최첨단 방법 대비 공격 성공률과 자연스러움 측면에서 어떻게 비교되는가?
  • RQ3HydraText는 인간 평가에서 인간이 작성한 텍스트와 구분하기 어려운 정도로 악성 예제를 생성할 수 있는가?
  • RQ4HydraText는 점수 기반 및 결정 기반 공격 설정 모두에서 뛰어난 성능을 유지하는가?
  • RQ5HydraText가 생성한 악성 예제는 악성 훈련을 통해 타겟 모델의 강건성을 향상시키는 데 기여하는가?

주요 결과

  • 점수 기반 설정에서 HydraText는 BERT에서 73.90%, Infersent에서 74.66%, ESIM에서 70.93%의 경쟁 가능한 공격 성공률를 기록했으며, 인지 불가능성 측면에서 기존 기준보다 뚜렷이 뛰어나다.
  • 결정 기반 설정에서는 BERT에서 82.57%, Infersent에서 84.27%, ESIM에서 79.12%의 성공률를 달성했고, 모든 기준보다 높은 유사도 점수(0.571, 0.610, 0.601)를 확보했다.
  • 인간 평가 결과, HydraText가 생성한 악성 예제는 기존 기준 대비 더 자연스럽고 인간이 작성한 텍스트와 구분하기 어려운 것으로 확인되었다.
  • HydraText가 생성한 악성 예제는 뛰어난 이식 가능성을 보이며, 악성 훈련에 활용될 경우 타겟 모델의 강건성을 효과적으로 향상시켰다.
  • 기존 기준 대비 공격 당 평균 쿼리 수를 감소시켜(예: 점수 기반 설정에서 BERT 기준 244.4회), 쿼리 효율성이 향상됨을 확인했다.
  • 대상 공격 설정에서도 HydraText는 고성능을 유지하며(예: BERT 기준 82.57%), 뛰어난 유사도 점수를 확보함으로써 제약 조건이 있는 공격 상황에서도 효과적인 것으로 입증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.