[논문 리뷰] Contextualized Perturbation for Textual Adversarial Attack
CLARE는 사전에 훈련된 마스크된 언어 모델을 기반으로 한 마스크-그리고-채우기 접근 방식을 사용하는 문맥 기반 적대적 예제 생성 모델입니다. 이 모델은 Replace, Insert, Merge 세 가지 문맥 인식 편집 기반의 편집 방법을 사용합니다. CLARE는 기존의 기준 방법보다 공격 성공률이 높고 편집 수가 적으며 유창하고 문법적으로 올바르며 의미적으로 유사한 적대적 텍스트를 생성합니다.
Adversarial examples expose the vulnerabilities of natural language processing (NLP) models, and can be used to evaluate and improve their robustness. Existing techniques of generating such examples are typically driven by local heuristic rules that are agnostic to the context, often resulting in unnatural and ungrammatical outputs. This paper presents CLARE, a ContextuaLized AdversaRial Example generation model that produces fluent and grammatical outputs through a mask-then-infill procedure. CLARE builds on a pre-trained masked language model and modifies the inputs in a context-aware manner. We propose three contextualized perturbations, Replace, Insert and Merge, allowing for generating outputs of varied lengths. With a richer range of available strategies, CLARE is able to attack a victim model more efficiently with fewer edits. Extensive experiments and human evaluation demonstrate that CLARE outperforms the baselines in terms of attack success rate, textual similarity, fluency and grammaticality.
연구 동기 및 목표
- 자연어 처리 모델을 위한 적대적 텍스트를 생성하는 데 있어 히وري스틱이고 문맥에 무관한 방법의 한계를 해결하기 위해.
- 사전에 훈련된 언어 모델에서 유래한 문맥 지식을 활용하여 적대적 예제의 유창성, 문법성, 의미 유사도를 향상시키기 위해.
- 고정 길이 토큰 대체 방법의 제약을 극복하고 출력 길이가 다양해지는 탄력적인 편집을 가능하게 하기 위해.
- 입력 수정 수를 최소화하면서 모델 탈출을 최대화하는 효과적인 블랙박스 공격 전략을 개발하기 위해.
- CLARE가 생성한 예제가 특히 데이터가 부족한 조건에서 적대적 훈련을 통해 모델의 강건성을 향상시킬 수 있음을 입증하기 위해.
제안 방법
- CLARE는 마스크-그리고-채우기 절차를 사용합니다: 입력의 특정 위치를 마스크하고, 사전에 훈련된 마스크된 언어 모델(RoBERTa 등)을 사용해 그 부분을 채웁니다.
- 세 가지 문맥 기반 편집 동작을 도입합니다: Replace(토큰 대체), Insert(새로운 토큰 삽입), Merge(이중어를 하나의 토큰으로 통합).
- 각 편집은 공격 성공률과 원본 입력과의 유사도 기반으로 평가되고 순위가 매겨지며, 반복적인 개선이 가능합니다.
- 모델는 내부 파rameter에 접근할 수 없고, 오직 타겟 모델의 예측 결과만을 사용하는 블랙박스 설정에서 작동합니다.
- 편집은 입력 시퀀스의 어떤 위치에나 적용 가능하므로 탄력적이고 타겟된 수정이 가능합니다.
- 문장 임베딩과 코사인 유사도 임계값을 사용하여 텍스트 유사도를 유지함으로써 원본 입력과 인간이 인지할 수 있을 정도의 유사도를 확보합니다.
실험 결과
연구 질문
- RQ1히وري스틱이고 문맥에 무관한 방법에 비해, 문맥 기반 편집은 적대적 텍스트의 유창성과 문법성 향상에 기여할 수 있는가?
- RQ2CLARE는 다양한 출력 길이를 가진 적대적 예제를 얼마나 잘 생성할 수 있는가, 이때도 높은 공격 성공률을 유지하는가?
- RQ3공격 성공률, 텍스트 유사도, 유창성, 문법성 측면에서 CLARE는 최신 기준 방법들과 비교해 어떻게 성과를 내는가?
- RQ4CLARE가 생성한 적대적 예제는 특히 훈련 데이터가 제한된 상황에서 하류 NLP 모델의 강건성을 향상시킬 수 있는가?
- RQ5사전에 훈련된 마스크된 언어 모델의 사용이 더 자연스럽고 의미적으로 일관된 적대적 예제를 생성하는 데 기여하는가?
주요 결과
- CLARE는 텍스트 분류, 자연어 추론, 문장 동의어 생성 등의 과제에서 기준 방법들보다 높은 공격 성공률를 기록했습니다.
- 인간 평가 결과, CLARE가 생성한 예제는 기준 방법의 결과보다 유창성과 문법성 측면에서 유의미하게 뛰어났습니다.
- 문장 임베딩 코사인 유사도로 측정했을 때, CLARE는 동의어 기반 및 히وري스틱 방법보다 원본 입력과 더 높은 텍스트 유사도를 유지했습니다.
- 성공적인 공격를 달성하기 위해 필요한 편집 수가 적어, 편집의 효율성이 뛰어났습니다.
- CLARE가 생성한 예제를 사용한 적대적 훈련은 특히 데이터가 적은 환경에서 피팅된 BERT 모델의 강건성을 향상시켰습니다.
- Replace, Insert, Merge 편집의 조합은 의미를 유지하면서 탐지 회피를 가능하게 하는 탄력적이고 문맥 인식 편집을 가능하게 했습니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.