Skip to main content
QUICK REVIEW

[논문 리뷰] On Evaluation of Adversarial Perturbations for Sequence-to-Sequence Models

Paul Michel, Xian Li|arXiv (Cornell University)|2019. 03. 15.
Adversarial Robustness in Machine Learning참고 문헌 39인용 수 15
한 줄 요약

이 논문은 원본 입력과 변형된 입력 간의 의미 동일성을 강제함으로써, 특히 번역 모델인 시퀀스 투 시퀀스 모델에서의 적대적 편향에 대한 의미 유지 평가 프레임워크를 제안한다. 기존 공격 방식이 의미를 유지하지 못함을 입증하고, 의미 유지 성능을 향상시키기 위해 CharSwap 제약 조건을 도입하며, 이러한 제약 조건이 포함된 적대적 훈련이 표준 성능을 해치지 않으면서도 모델의 강건성을 향상시킴을 보여준다.

ABSTRACT

Adversarial examples --- perturbations to the input of a model that elicit large changes in the output --- have been shown to be an effective way of assessing the robustness of sequence-to-sequence (seq2seq) models. However, these perturbations only indicate weaknesses in the model if they do not change the input so significantly that it legitimately results in changes in the expected output. This fact has largely been ignored in the evaluations of the growing body of related literature. Using the example of untargeted attacks on machine translation (MT), we propose a new evaluation framework for adversarial attacks on seq2seq models that takes the semantic equivalence of the pre- and post-perturbation input into account. Using this framework, we demonstrate that existing methods may not preserve meaning in general, breaking the aforementioned assumption that source side perturbations should not result in changes in the expected output. We further use this framework to demonstrate that adding additional constraints on attacks allows for adversarial perturbations that are more meaning-preserving, but nonetheless largely change the output sequence. Finally, we show that performing untargeted adversarial training with meaning-preserving attacks is beneficial to the model in terms of adversarial robustness, without hurting test performance. A toolkit implementing our evaluation framework is released at https://github.com/pmichel31415/teapot-nlp.

연구 동기 및 목표

  • 기존의 자연어 처리(NLP) 모델, 특히 시퀀스 투 시퀀스(seq2seq) 환경에서의 적대적 공격가 의미 일관성이 부족한 문제를 해결하기 위해.
  • 원본 쪽은 의미를 유지하지만 타겟 쪽은 의미를 파괴하는 적대적 예제에 대한 형식화된 기준을 제시하기 위해.
  • chrF와 같은 자동 평가 지표가 적대적 편향에서의 의미 유사성에 대한 인간 평가를 얼마나 잘 근사하는지 평가하기 위해.
  • 제약 조건이 부여된 적대적 공격이 성능 저하 없이 강건성을 향상시킬 수 있는지 조사하기 위해.
  • 의미 유지 공격을 사용한 적대적 훈련의 이점을 입증하기 위해.

제안 방법

  • 원본 입력의 의미 유지와 타겟 출력의 성능 저하를 기준으로 적대적 공격을 평가하는 프레임워크를 제안한다.
  • 기울기 기반 단어 교체 공격에 대해 의미 유지 가능성을 높이기 위해 CharSwap 기반 제약 조건을 도입한다.
  • 원본과 변형된 입력 간의 의미 유사성에 대한 인간 평가를 대체로 chrF를 사용한다.
  • 기본 예제와 적대적 예제를 균형 있게 조합하기 위해 하이퍼파rameter α를 사용하는 하이브리드 훈련 목표 함수를 적용한다.
  • 비제약 및 CharSwap 제약이 부여된 공격를 모두 사용하여 적대적 훈련을 수행함으로써 모델의 강건성을 향상시킨다.
  • 자동 평가 지표(ChrF, BLEU, METEOR)를 사용하여 결과를 검증하고 인간 평가와 비교한다.

실험 결과

연구 질문

  • RQ1기존의 무표적 적대적 공격이 번역 모델에서 원본 입력의 의미를 얼마나 잘 유지하는가?
  • RQ2BLEU, METEOR, 또는 chrF 중에서 어떤 자동 평가 지표가 적대적 편향에서의 의미 유사성에 대한 인간 평가와 가장 높은 상관관계를 가지는가?
  • RQ3적대적 공격에 제약 조건을 추가하면 공격의 효과성은 유지하면서도 의미 유지 성능을 향상시킬 수 있는가?
  • RQ4의미 유지 공격을 사용한 적대적 훈련이 청소된 데이터에서의 성능 저하 없이 모델의 강건성을 향상시킬 수 있는가?
  • RQ5훈련 중에 청소된 데이터와 적대적 데이터 간의 트레이드오프가 모델 성능과 강건성에 어떤 영향을 미치는가?

주요 결과

  • 적대적 편향 평가에서 chrF 지표는 BLEU나 METEOR보다 인간 평가의 의미 유사성 판단과 유의미하게 더 높은 상관관계를 보였다.
  • 제약 조건이 없는 기울기 기반 공격는 원본과 변형된 입력 간의 의미 유사성이 낮아 의미 유지에 실패하는 경우가 많다는 점이 입증되었다.
  • CharSwap 제약 조건이 부여된 공격는 여전히 모델 출력의 성능 저하를 효과적으로 유도하면서도 의미 유지 성능이 상당히 향상된 편향을 생성하였다.
  • CharSwap 제약 조건이 부여된 공격를 사용한 적대적 훈련은 유사 공격에 비해 훨씬 뛰어난 강건성을 확보하였으며, cs-en 검증 세트에서 16.46 RDchrF 점수를 기록하였다(비제약 조건 공격 대비 25.99).
  • α=1.0일 때, CharSwap-adv 모델은 cs-en에서 43.74 chrF를 기록하여 기본 모델과 유사한 테스트 성능을 유지하였고, 비제약 조건 모델은 41.38 chrF로 성능이 저하되었다.
  • α=0.5일 때, CharSwap-adv 모델은 cs-en에서 44.57 chrF를 기록하였으며, 가장 뛰어난 강건성(20.41 RDchrF)을 보였고, 기본 모델과 비제약 조건 모델을 모두 압도하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.