Skip to main content
QUICK REVIEW

[논문 리뷰] A Prompting-based Approach for Adversarial Example Generation and Robustness Enhancement

Yuting Yang, Pei Huang|arXiv (Cornell University)|2022. 03. 21.
Adversarial Robustness in Machine Learning인용 수 4
한 줄 요약

이 논문은 사전 학습된 언어 모델(PLM)을 활용해 마스크된 토큰을 채우는 방식으로 악성 프롬프트를 설계함으로써 자연스럽고 유창하며 다양한 악성 예측 예제를 생성하는 프롬프팅 기반의 대안적 공격(PAT)을 제안한다. 이는 타겟 모델을 쿼리하지 않고도 높은 공격 성공률를 달성한다. 또한, 공격 예제 생성 과정에서 시간이 오래 걸리는 악성 예제 생성에 의존하지 않고도 모델의 강건성을 높이는 프롬프팅 기반의 악성 훈련 방법을 추가로 제안하여 기존 방법에 비해 최대 10% 향상된 강건성 정확도를 달성한다.

ABSTRACT

Recent years have seen the wide application of NLP models in crucial areas such as finance, medical treatment, and news media, raising concerns of the model robustness and vulnerabilities. In this paper, we propose a novel prompt-based adversarial attack to compromise NLP models and robustness enhancement technique. We first construct malicious prompts for each instance and generate adversarial examples via mask-and-filling under the effect of a malicious purpose. Our attack technique targets the inherent vulnerabilities of NLP models, allowing us to generate samples even without interacting with the victim NLP model, as long as it is based on pre-trained language models (PLMs). Furthermore, we design a prompt-based adversarial training method to improve the robustness of PLMs. As our training method does not actually generate adversarial samples, it can be applied to large-scale training sets efficiently. The experimental results show that our attack method can achieve a high attack success rate with more diverse, fluent and natural adversarial examples. In addition, our robustness enhancement method can significantly improve the robustness of models to resist adversarial attacks. Our work indicates that prompting paradigm has great potential in probing some fundamental flaws of PLMs and fine-tuning them for downstream tasks.

연구 동기 및 목표

  • 악성으로 설계된 프롬프트가 사전 학습된 언어 모델(PLM)의 내재된 강건성 결함을 드러내는지 조사하기.
  • 타겟 모델과 반복적인 상호작용이 필요 없는 쿼리 효율적인 악성 공격 방법을 개발하기.
  • 기존의 검색 기반 방법에 비해 더 자연스럽고, 유창하며 다양한 악성 예측 예제를 생성하기.
  • 악성 예제 생성 과정을 명시적으로 수행할 필요 없이 악성 프롬프트를 훈련 중에 삽입함으로써 모델의 강건성을 향상시키는 프롬프팅 기반의 악성 훈련 기법을 설계하기.
  • 프롬프팅이 PLM의 근본적인 취약점을 탐지하고 보완하는 데 효과적인 패러다임이 될 수 있음을 보여주기.

제안 방법

  • 악성 트리거 텍스트를 포함한 마스크된 입력을 가진 프롬프트 템플릿을 구성하여 특정한 악성 의도를 전달한다.
  • 사전 학습된 언어 모델을 사용해 프롬프트의 마스크된 자리에 텍스트를 채워, 악성 의도를 포함한 다듬어진 문장을 생성한다.
  • 트리거 텍스트를 제거함으로써 의미적으로 일관성을 유지하면서도 하류 분류기를 오도하는 자연스러운 보이지 않는 악성 예측 예제를 확보한다.
  • 몇 개의 알려진 악성 예제를 사용해 프롬프팅 기반 공격를 미세조정하여 공격 성능을 향상시키며, 모델이 예제로부터 학습하는 방식을 모방한다.
  • 악성 프롬프트를 미세조정 중에 삽입함으로써 악성 예제를 명시적으로 생성할 필요 없이 프롬프팅 기반의 악성 훈련 방법을 설계한다.
  • 프롬프팅 기반 훈련을 하류 모델에 적용하여 정상 정확도를 유지하면서도 강건성을 향상시킨다.

실험 결과

연구 질문

  • RQ1악성으로 구성된 프롬프트가 사전 학습된 언어 모델의 내재된 취약점을 효과적으로 악용하여 악성 예측 예제를 생성할 수 있는가?
  • RQ2프롬프팅 기반 방법이 검색 기반 방법보다 더 자연스럽고, 더 유창하며 더 다양한 악성 예측 예제를 생성할 수 있는가?
  • RQ3타겟 모델을 쿼리하지 않고도 프롬프팅 기반 공격가 얼마나 높은 성공률를 달성할 수 있는가?
  • RQ4프롬프팅 기반의 악성 훈련이 정상 정확도를 손상시키지 않고 모델의 강건성을 상당히 향상시킬 수 있는가?
  • RQ5프롬프팅이 NLP 모델의 강건성 분석 및 향상에 대해 확장 가능하고 효과적인 패러다임이 될 수 있는가?

주요 결과

  • 제안된 PAT 공격는 MR 데이터셋에서 43.02%의 높은 공격 성공률와 IMDB 데이터셋에서 36.87%의 성공률를 기록했으며, 기존의 검색 기반 기준에 비해 훨씬 뛰어난 유창성과 다양성을 확보했다.
  • SNLI 데이터셋에서 PAT는 강건성 정확도 44.50%를 기록했으며, 동일한 공격 조건에서 기준 BERT 모델(29.50%)과 악성 훈련 방법(22.00%)을 모두 초월했다.
  • 프롬프팅 기반의 악성 훈련 방법은 기존의 악성 훈련 대비 약 10% 향상된 강건성 정확도를 확보했으며, 정상 정확도는 2% 이내의 감소만을 보였다.
  • 정상 정확도를 유지하면서도 강건성을 크게 향상시켜 정확도와 강건성 간의 유리한 트레이드오프를 보였다 (예: MR에서 89.50%, IMDB에서 92.20%).
  • 실험 결과, 프롬프팅 기반 훈련 방법은 악성 예제 생성 과정이 비용이 많이 들기 때문에 비용 효율적이고 확장 가능한 것으로 나타났다.
  • 결과는 철저하게 설계된 프롬프트가 PLM의 강건성 결함을 효과적으로 탐지하고 악용할 수 있음을 시사하며, 프롬프팅이 강건성 분석 및 향상에 있어 유망한 패러다임임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.