[논문 리뷰] T3: Tree-Autoencoder Constrained Adversarial Text Generation for Targeted Attack
T3는 텍스트를 연속적인 공간으로 매핑하여 기울기 기반 최적화를 가능하게 하고, 트리 문법 규칙을 사용해 복호화함으로써 문법적·의미적 일관성을 유지하는 트리-오토에인코더 기반 프레임워크를 제안한다. 이는 감성 분석 및 질의응답(QA)과 같은 다양한 NLP 작업에서 높은 공격 성공률를 달성하면서도 인간의 가독성과 블랙박스 전이 공격을 유지한다.
Adversarial attacks against natural language processing systems, which perform seemingly innocuous modifications to inputs, can induce arbitrary mistakes to the target models. Though raised great concerns, such adversarial attacks can be leveraged to estimate the robustness of NLP models. Compared with the adversarial example generation in continuous data domain (e.g., image), generating adversarial text that preserves the original meaning is challenging since the text space is discrete and non-differentiable. To handle these challenges, we propose a target-controllable adversarial attack framework T3, which is applicable to a range of NLP tasks. In particular, we propose a tree-based autoencoder to embed the discrete text data into a continuous representation space, upon which we optimize the adversarial perturbation. A novel tree-based decoder is then applied to regularize the syntactic correctness of the generated text and manipulate it on either sentence (T3(Sent)) or word (T3(Word)) level. We consider two most representative NLP tasks: sentiment analysis and question answering (QA). Extensive experimental results and human studies show that T3 generated adversarial texts can successfully manipulate the NLP models to output the targeted incorrect answer without misleading the human. Moreover, we show that the generated adversarial texts have high transferability which enables the black-box attacks in practice. Our work sheds light on an effective and general way to examine the robustness of NLP models. Our code is publicly available at https://github.com/AI-secure/T3/.
연구 동기 및 목표
- 의미를 유지하고 문법적으로 올바른 표적 적대적 텍스트를 생성하면서도 인간의 감지에서 피하는 도전 과제를 해결하기 위해.
- 특히 이미지와 같은 연속 영역과 비교할 때 이산적이고 미분 불가능한 텍스트 공간에서의 적대적 공격 생성의 한계를 극복하기 위해.
- 감성 분석 및 질의응답과 같은 다양한 NLP 작업에 적용 가능한 일반적인 목적의 표적 제어가 가능한 공격 프레임워크를 개발하기 위해.
- 특히 BERT와 같은 최신 NLP 모델이 표적 적대적 환경에서 얼마나 강건한지 평가하기 위해.
- 실제 블랙박스 공격 시나리오에서 NLP 분야의 적대적 예제의 전이 가능성에 대해 조사하기 위해.
제안 방법
- 대규모 코퍼스에서 트리 기반 오토에인코더를 미리 훈련시켜 이산적 텍스트를 연속적인 의미 임베딩 공간으로 매핑함으로써 기울기 기반 최적화를 가능하게 한다.
- 의존성 트리의 계층적 구조를 활용하여 단어 수준(T3(Word)) 또는 문장 수준(T3(Sent))에서 연속 임베딩 공간에 적대적 변형을 적용한다.
- 문법 규칙을 사용해 변형된 임베딩에서 트리 기반 디코더가 적대적 텍스트를 재구성함으로써 문법적 구조와 의미 내용을 유지한다.
- 반복 최적화 과정을 통해 공격 성공률를 극대화하면서도 감지 가능한 변화를 최소화하도록 변형을 조정한다.
- 이 프레임워크는 자리바꿈 공격과 삽입 공격을 모두 지원하며, 후자는 원본 입력에 적대적 문장을 추가한다.
- 유사한 아키텍처를 가진 다른 모델로 전이 가능한 블랙박스 공격을 위해, 한 모델에서 적대적 예제를 생성하고 이를 다른 모델로 전이한다.
실험 결과
연구 질문
- RQ1어느 수준의 트리 계층—단어 수준 또는 문장 수준—에서 더 효과적이고 자연스러운 적대적 공격이 이루어지는가?
- RQ2감성 분류 및 질의응답과 같은 일반적인 NLP 작업에 대해 표적 공격이 고성공률로 성공적으로 적용될 수 있는가?
- RQ3특히 블랙박스 설정에서, 적대적 예제가 얼마나 잘 전이되는가?
- RQ4모델 아키텍처와 어텐션 메커니즘(예: BERT의 장거리 어텐션)이 적대적 공격의 효과성에 어떤 영향을 미치는가?
- RQ5적대적 예제는 인간의 성능을 크게 떨어뜨리는가, 아니면 인간 독자에게 감지되지 않는가?
주요 결과
- T3(Word)는 다양한 작업에서 가장 높은 공격 성공률를 기록하지만, T3(Sent)는 더 문법적으로 올바르고 인간이 감지하기 어려운 적대적 문장을 생성한다.
- T3로 생성된 적대적 예제는 감성 분류 및 QA 작업 모두에서 NLP 모델이 표적 오답을 출력하도록 성공적으로 조작했으며, 인간 평가자들을 오도하지 않았다.
- 적대적 예제의 전이 가능성은 매우 강력하며, 특히 강력한 모델(예: BERT-QA)에서 약한 모델(예: BiDAF)으로 전이할 경우 역방향 전이보다 높은 성공률를 기록한다.
- 유사한 아키텍처를 가진 모델 간의 전이 가능성은 다른 아키텍처 간 전이보다 높다.
- BERT 모델은 표적 적대적 공격에서 심각한 성능 저하를 보이며, 높은 정확도를 기록하고 있음에도 불구하고 강건하지 않음을 시사한다.
- BERT 모델을 공격할 때, 단락의 시작이나 끝에 적대적 문장을 첨부하는 것이 중간에 삽입하는 것보다 더 효과적이며, 이는 BERT의 어텐션 구조가 문장 경계 쪽에 편향되어 있기 때문이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.