Skip to main content
QUICK REVIEW

[논문 리뷰] FastWordBug: A Fast Method To Generate Adversarial Text Against NLP Applications

Dou Goodman, Zhonghou Lv|arXiv (Cornell University)|2020. 01. 31.
Adversarial Robustness in Machine Learning참고 문헌 5인용 수 5
한 줄 요약

FastWordBug는 문장 품사(POS) 태그 가중치를 활용하여 고영향도 단어를 식별함으로써 NLP 모델을 속이기 위해 효율적으로 텍스트 변형을 생성하는 블랙박스 적대적 공격 프레임워크이다. 모델 쿼리 수를 최소화하면서 Text-CNN에서 최소 13.0%로, Word-LSTM에서 최소 21.0%로 모델 정확도를 떨어뜨리며, 다양한 모델과 클라우드 API 간에 높은 공격 효율성과 이식 가능성을 입증하였다.

ABSTRACT

In this paper, we present a novel algorithm, FastWordBug, to efficiently generate small text perturbations in a black-box setting that forces a sentiment analysis or text classification mode to make an incorrect prediction. By combining the part of speech attributes of words, we propose a scoring method that can quickly identify important words that affect text classification. We evaluate FastWordBug on three real-world text datasets and two state-of-the-art machine learning models under black-box setting. The results show that our method can significantly reduce the accuracy of the model, and at the same time, we can call the model as little as possible, with the highest attack efficiency. We also attack two popular real-world cloud services of NLP, and the results show that our method works as well.

연구 동기 및 목표

  • 모델 쿼리 수를 최소화하는 빠르고 효율적인 NLP 모델을 대상으로 하는 블랙박스 적대적 공격 방법을 개발하기 위해.
  • 문장 품사(POS) 태그와 모델 예측에 영향을 미치는 단어의 중요도 간의 관계를 정량화하기 위해.
  • POS 태그 가중치와 신뢰도 감소를 기반으로 고영향도 단어만 필터링하여 공격 효율을 향상시키기 위해.
  • 실제 데이터셋과 상용 NLP 클라우드 서비스에서의 효과를 평가하기 위해.
  • 다양한 모델과 API 간에 적대적 예제의 이식 가능성을 입증하기 위해.

제안 방법

  • 단어를 제거했을 때의 신뢰도 감소를 기반으로 한 점수 함수 $ C_{w_j} = \mathcal{F}_y(w) - \mathcal{F}_y(w \setminus w_j) $ 를 정의하여 단어 중요도를 평가한다.
  • 데이터셋 전반에서 최대 신뢰도 감소를 유발하는 단어와 관련된 각 POS 태그의 빈도를 측정하여 POS 태그 가중치를 계산한다.
  • 각 POS 태그별로 영향력이 높은 상위 단어의 빈도를 기반으로 소프트맥스 정규화된 가중치 벡터 $ W(t) $ 를 유도하여 단어 수정 우선순위를 정한다.
  • 공격 파이프라인은 먼저 모델의 신뢰도 점수를 활용해 중요 문장을 식별한 후, 임계값을 초과하는 높은 POS 태그 가중치를 가진 단어를 필터링한다.
  • 고영향도 단어를 의미적으로 유사한 동의어로 교체함으로써 적대적 예제를 생성하며, 텍스트의 유용성은 유지하면서 예측을 뒤바꾸는 데 초점을 맞춘다.
  • 이 방법은 블랙박스 위협 모델에 기반하며, 모델 쿼리 출력값(예측 및 신뢰도 점수) 외에는 추가 정보를 사용하지 않는다.

실험 결과

연구 질문

  • RQ1문장 품사(POS) 태그 정보를 활용하여 적대적 변형을 위해 가장 영향력이 큰 단어를 효율적으로 식별할 수 있는가?
  • RQ2모델 쿼리 수를 줄임으로써 NLP 모델에 대한 적대적 공격의 효율성을 어떻게 향상시킬 수 있는가?
  • RQ3FastWordBug가 생성한 적대적 예제는 다양한 NLP 모델과 클라우드 기반 API 간에 얼마나 잘 이식 가능한가?
  • RQ4FastWordBug는 실세계 텍스트 분류 및 감성 분석 작업에서 모델 정확도를 얼마나 효과적으로 낮출 수 있는가?
  • RQ5최소한의 변형으로 높은 공격 성공률를 달성하면서도 의미적 유사성은 유지할 수 있는가?

주요 결과

  • FastWordBug는 IMDB 감성 분류 데이터셋에서 Text-CNN의 정확도를 87.0%에서 13.0%로, Word-LSTM의 정확도를 78.0%에서 21.0%로 낮추며 최소한의 모델 쿼리로 성능 저하를 이끌었다.
  • AG’s News 텍스트 분류에서, 이 방법은 Text-CNN의 정확도를 36.0%로, Word-LSTM의 정확도를 31.5%로 낮혀 강력한 공격 효과를 입증했다.
  • 두 가지 실세계 클라우드 NLP 서비스인 Aylien Sentiment과 ParallelDots를 성공적으로 공격하여, 음성 예측을 50% 이상의 신뢰도로 양성 예측으로 뒤바꾸는 데 성공했다.
  • 적대적 예제는 강력한 이식 가능성을 보였다: Text-CNN에서 생성한 공격의 64.5%가 Word-LSTM로 이식되었고, Word-LSTM에서 생성한 공격의 83.5%가 Text-CNN로 이식되었다.
  • POS 기반 필터링을 통해 FastWordBug는 모델 호출 수를 크게 줄였으며, 본 연구에서 보고된 바 중 가장 높은 공격 효율성을 달성했다.
  • 의미적 유사성은 유지되었으며, 원본 텍스트의 최소한의 변경과 적대적 예제의 가독성 유지로 이를 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.