Skip to main content
QUICK REVIEW

[논문 리뷰] Adversarial Attack and Defense of Structured Prediction Models

Wenjuan Han, Liwen Zhang|arXiv (Cornell University)|2020. 10. 04.
Adversarial Robustness in Machine Learning참고 문헌 34인용 수 4
한 줄 요약

이 논문은 강화학습을 통해 다수의 기준 모델의 피드백을 받는 시퀀스-투-시퀀스 생성기로 훈련된 새로운 블랙박스 온라인 적대적 공격 프레임워크를 제안한다. 이는 자연어처리 분야의 구조적 예측 모델에 적용된다. 이 방법은 유창하고 매우 적대적인 문장을 생성하여 최신의 의존성 파서와 POS 태거를 효과적으로 속이며, 적대적 훈련을 통해 모델의 강건성을 향상시킨다. 공격 성공률는 문장 수준에서 최대 80.1%에 이를 수 있으며, 유창성 향상 효과도 뚜렷하다.

ABSTRACT

Building an effective adversarial attacker and elaborating on countermeasures for adversarial attacks for natural language processing (NLP) have attracted a lot of research in recent years. However, most of the existing approaches focus on classification problems. In this paper, we investigate attacks and defenses for structured prediction tasks in NLP. Besides the difficulty of perturbing discrete words and the sentence fluency problem faced by attackers in any NLP tasks, there is a specific challenge to attackers of structured prediction models: the structured output of structured prediction models is sensitive to small perturbations in the input. To address these problems, we propose a novel and unified framework that learns to attack a structured prediction model using a sequence-to-sequence model with feedbacks from multiple reference models of the same structured prediction task. Based on the proposed attack, we further reinforce the victim model with adversarial training, making its prediction more robust and accurate. We evaluate the proposed framework in dependency parsing and part-of-speech tagging. Automatic and human evaluations show that our proposed framework succeeds in both attacking state-of-the-art structured prediction models and boosting them with adversarial training.

연구 동기 및 목표

  • 구조적 예측 모델에 대한 공격 문제를 다루기 위해, 입력 편향에 매우 민감하고 분류 작업과 근본적으로 다른 특성을 지닌 자연어처리 분야의 구조적 예측 모델에 대한 도전 과제를 해결한다.
  • 이산 토큰 제약 조건과 문장의 자연스러움 문제로 인해 실패하는 기울기 기반 및 워드 수준 공격 방법의 한계를 극복한다.
  • 모델의 기울기나 반복 최적화가 필요 없는 블랙박스, 온라인 공격자 설계를 통해 효율적이고 일반화 가능한 공격을 가능하게 한다.
  • 생성된 적대적 예제를 사용한 적대적 훈련을 통해 방어 메커니즘을 개발하여 모델의 강건성을 향상시킨다.

제안 방법

  • 구성된 다수의 기준 모델을 대상으로 동일한 구조적 예측 작업에 대해 피해 모델의 출력을 평가하는 커스터마이즈된 보상 함수를 사용하여 강화학습으로 훈련된 시퀀스-투-시퀀스(시퀀스-투-시퀀스) 문장 생성기가 사용된다.
  • 보상 함수는 세 가지 구성 요소를 포함한다: 피해 모델의 출력 확률, 피해 모델과 기준 모델의 출력 간 유사도, 사전 학습된 언어 모델을 통한 문장의 자연스러움 점수.
  • 공격은 블랙박스 설정에서 수행되며, 피해 모델의 아키텍처, 파라미터, 기울기 정보에 접근할 필요가 없다. 이는 광범위한 적용 가능성을 보장한다.
  • 공격은 온라인 방식이다. 훈련이 끝난 후, 생성기는 추가 최적화나 모델 접근 없이 입력 문장에서 직접 적대적 예제를 생성한다.
  • 적대적 훈련은 피해 모델을 생성된 적대적 예제로 미세조정함으로써 적용되며, 이는 모델의 강건성과 정확도 향상에 기여한다.
  • 자동 평가 및 인간 평가를 통한 평가가 의존성 파싱 및 POS 태깅 작업에서 수행되었다.

실험 결과

연구 질문

  • RQ1다중 기준 피드백을 활용한 시퀀스-투-시퀀스 기반 생성기가 자연어처리 분야의 구조적 예측 모델을 효과적으로 공격할 수 있는 적대적 예제를 생성할 수 있는가?
  • RQ2기준 모델의 선택(동일한 모델 vs. 다른 모델)이 생성된 예제의 자연스러움과 적대적 효과성에 어떤 영향을 미치는가?
  • RQ3제안된 공격 프레임워크는 다양한 구조적 예측 모델과 아키텍처에 효과적으로 적용될 수 있는가?
  • RQ4생성된 예제를 사용한 적대적 훈련이 피해 모델의 강건성과 정확도 향상에 얼마나 기여하는가?
  • RQ5기존의 기울기 기반 또는 워드 수준 공격 방법과 비교할 때, 공격 성공률와 문장의 자연스러움 측면에서 제안된 방법은 어떤가?

주요 결과

  • 제안된 공격 프레임워크는 Deep Biaffine 및 BiST 파서를 기준 모델로 사용하여 의존성 파싱에서 문장 수준 공격 성공률가 80.1%에 도달했으며, 기준 방법들보다 뚜렷이 뛰어나다.
  • 인간 평가 결과, 생성된 적대적 문장의 자연스러움 점수는 3.84점(5점 만점 기준)을 기록했으며, AllSame(4.19) 및 EvalSame(3.54) 설정보다 더 우수한 자연스러움과 공격 효과성의 균형을 보였다.
  • 공격 프레임워크는 최신의 구조적 예측 모델이 조그만 편집과 자연스러운 문장으로도 잘못된 파싱 트리나 POS 태그를 생성하도록 유도하는 적대적 예제를 성공적으로 생성했다.
  • 생성된 예제를 사용한 적대적 훈련은 피해 모델의 강건성과 정확도를 향상시켜, 방어 메커니즘의 효과성을 입증했다.
  • 프레임워크는 일반화 가능성이 높다. 다양한 피해 모델(예: StackPtr)과 기준 파서 조합에서 일관된 성능을 기록하여 광범위한 적용 가능성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.