Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Textual Embedding against Word-level Adversarial Attacks

Yichen Yang, Xiaosen Wang|arXiv (Cornell University)|2022. 02. 28.
Adversarial Robustness in Machine Learning인용 수 10
한 줄 요약

이 논문은 단어 수준의 적대적 공격에 대한 강건성을 향상시키기 위해 동의어를 임bedding 공간에서 더 가깝게 하고 비동의어를 더 멀리 떼어내는 단어 임베딩을 학습하는 새로운 방법인 Fast Triplet Metric Learning (FTML)을 제안한다. FTML은 최소한의 학습 오버헤드로 다양한 모델(CNN, LSTM, BERT)에서 최신 기준의 강건한 정확도를 달성하며, PWWS 및 HLA와 같은 공격에 대해 뛰어난 저항성을 보이며 청소된 정확도를 유지한다.

ABSTRACT

We attribute the vulnerability of natural language processing models to the fact that similar inputs are converted to dissimilar representations in the embedding space, leading to inconsistent outputs, and we propose a novel robust training method, termed Fast Triplet Metric Learning (FTML). Specifically, we argue that the original sample should have similar representation with its adversarial counterparts and distinguish its representation from other samples for better robustness. To this end, we adopt the triplet metric learning into the standard training to pull words closer to their positive samples (i.e., synonyms) and push away their negative samples (i.e., non-synonyms) in the embedding space. Extensive experiments demonstrate that FTML can significantly promote the model robustness against various advanced adversarial attacks while keeping competitive classification accuracy on original samples. Besides, our method is efficient as it only needs to adjust the embedding and introduces very little overhead on the standard training. Our work shows great potential of improving the textual robustness through robust word embedding.

연구 동기 및 목표

  • 단어 수준의 적대적 공격으로 인해 의미적으로 유사한 문장이라도 예측이 일관되지 않게 되는 NLP 모델의 취약성을 해결하기 위해.
  • 임베딩 공간에서 의미적으로 유사한 입력들 간의 표현이 다를 경우 모델의 강건성이 떨어진다는 점을 규명하기 위해.
  • 동의어 교체에 대해 불변(invariant)인 강건한 단어 임베딩을 학습할 수 있는 일반적이고 효율적인 방법을 제안하기 위해.
  • 비싼 적대적 훈련이나 복잡한 인증된 방어 기법에 의존하지 않고 모델의 강건성을 향상시키기 위해.
  • 다양한 아키텍처, 특히 BERT를 포함한 표준 NLP 벤치마크에서 FTML의 효과성과 효율성을 입증하기 위해.

제안 방법

  • FTML은 임베딩 공간에서 단어를 그의 동의어(양성 샘플)에 더 가깝게 하고 비동의어(음성 샘플)에서 더 멀리 떼어내는 삼중 체계 손실을 도입한다.
  • 이 방법은 표준 훈련에 이 삼중 체계 손실을 통합하여, 임베딩 레이어에 최소한의 수정만으로도 거의 무시할 수 있는 계산 오버헤드로 구현된다.
  • 각 단어에 대해 동의어 사전을 활용하여 양성 및 음성 샘플을 정의함으로써 단어 표현의 타겟팅 최적화를 가능하게 한다.
  • BERT의 경우, 피니튜닝 중 어휘를 고빈도 실제 단어로 확장하여 전체 단어에 대한 임베딩 표현을 향상시킨다.
  • 표준 교차 엔트로피 손실과 삼중 체계 손실의 가중 조합을 사용하며, 청소된 정확도와 강건한 정확도 사이의 트레이드오프를 위해 하이퍼파라미터 α와 β를 튜닝한다.
  • 동의어 사전이 확보되어 있으면 어떤 언어에도 일반화 가능하여 영어를 넘어서 광범위한 적용 가능성을 제공한다.

실험 결과

연구 질문

  • RQ1동의어 간 유사도를 강조하여 더 일관된 단어 임베딩을 학습하는 것이 단어 수준의 적대적 공격에 대한 모델의 강건성을 향상시키는가?
  • RQ2기본적인 적대적 훈련과 비교할 때 제안된 삼중 체계 기반 거리 학습 방법은 강건성과 효율성 측면에서 어떻게 성능을 내는가?
  • RQ3BERT의 어휘를 실제 단어로 확장하는 것이 FTML의 성능에 어떤 영향을 미치는가?
  • RQ4FTML의 성능은 손실 함수의 하이퍼파라미터 α와 β에 얼마나 민감한가?
  • RQ5FTML은 다양한 모델과 데이터셋에서 높은 청소된 정확도를 유지하면서도 강건한 정확도를 크게 향상시킬 수 있는가?

주요 결과

  • BERT의 어휘가 실제 단어 50,000개로 확장된 경우, IMDB 데이터셋에서 PWWS 공격에 대해 FTML은 81.2%의 강건한 정확도를 달성했고, 표준 피니튜닝 BERT는 단지 16.6%에 그쳤다.
  • FTML로 훈련된 BERT 모델의 강건성은 어휘 크기가 커질수록 향상되며, 50,000개의 단어가 추가된 경우 81.2%의 강건한 정확도에 도달했고, 청소된 정확도는 약 92.2–92.5%로 안정적으로 유지되었다.
  • 어휘 확장 조차도 FTML은 높은 청소된 정확도(92.2–92.5%)를 유지하여 일반화 능력에 대한 악영향가 없음을 보여준다.
  • 하이퍼파라미터 변화에 대해 강건하며, β 값이 10⁻³에서 10³에 이르는 넓은 범위에서 안정적인 성능을 보이며, β=1일 때 최적의 트레이드오프를 달성한다.
  • FTML은 PWWS, HLA, GA 등 다양한 단어 수준의 공격에 대해 최신 기준의 베이스라인보다 뚜렷이 뛰어난 강건성을 보이며, 학습 오버헤드도 최소한으로 유지한다.
  • 이 방법은 다양한 모델에 대해 잘 일반화되며, 아키텍처 수정 없이도 CNN, LSTM, BERT 아키텍처에서 강력한 강건성 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.