Skip to main content
QUICK REVIEW

[논문 리뷰] Evaluating the Susceptibility of Pre-Trained Language Models via Handcrafted Adversarial Examples

Hezekiah J. Branch, Jonathan Rodriguez Cefalù|arXiv (Cornell University)|2022. 09. 05.
Adversarial Robustness in Machine Learning인용 수 13
한 줄 요약

이 논문은 사전 훈련된 언어 모델(PLM)이 낮은 토큰 수준의 변형을 유지하면서도 의미적 오분류를 유도하는 수작업으로 만든 적대적 예제에 얼마나 취약한지 평가한다. 이는 GPT-3와 BERT 계열 모델이 피팅 트레이닝 이전에 심각한 의미적 불일치를 감지하지 못하는 데에 실패하는 중요한 취약성을 드러낸다.

ABSTRACT

Recent advances in the development of large language models have resulted in public access to state-of-the-art pre-trained language models (PLMs), including Generative Pre-trained Transformer 3 (GPT-3) and Bidirectional Encoder Representations from Transformers (BERT). However, evaluations of PLMs, in practice, have shown their susceptibility to adversarial attacks during the training and fine-tuning stages of development. Such attacks can result in erroneous outputs, model-generated hate speech, and the exposure of users' sensitive information. While existing research has focused on adversarial attacks during either the training or the fine-tuning of PLMs, there is a deficit of information on attacks made between these two development phases. In this work, we highlight a major security vulnerability in the public release of GPT-3 and further investigate this vulnerability in other state-of-the-art PLMs. We restrict our work to pre-trained models that have not undergone fine-tuning. Further, we underscore token distance-minimized perturbations as an effective adversarial approach, bypassing both supervised and unsupervised quality measures. Following this approach, we observe a significant decrease in text classification quality when evaluating for semantic similarity.

연구 동기 및 목표

  • 피팅 트레이닝 이전의 사전 훈련된 언어 모델(PLM)이 수작업으로 만든 적대적 예제에 얼마나 강건한지 조사하기 위해.
  • GPT-3의 공개 버전, 특히 GPT-3 플레이그라운드에서 의미적 오분류가 최소한의 입력 변형으로 가능해지는 취약점을 폭 드러내기 위해.
  • 표준 거리 및 n-gram 메트릭(예: BLEU, BERTScore)이 모델 출력에서 의미적인 차이를 감지하지 못하는 실패를 평가하기 위해.
  • 최소한의 토큰 수준의 변형이 분류 결과를 극적으로 변화시킬 수 있지만, 일반적인 품질 평가 측정 방법에서는 감지되지 않는다는 것을 입증하기 위해.
  • 모델 평가에 의미 수준의 변형을 고려한 적대적 훈련 및 피팅 트레이닝 접근법을 권장하기 위해.

제안 방법

  • 저자들은 의미적 의미를 변경하면서도 표면 수준의 토큰 시퀀스 변화를 최소화하기 위해 수작업으로 설계된 토큰 수준의 변형을 통해 적대적 예제를 구성한다.
  • Levenshtein, Sørensen-Dice, Jaccard, Cosine 등의 다양한 거리 메트릭을 사용하여 모델 성능을 평가하며, 이는 토큰 수준과 시퀀스 수준에서 모두 계산된다.
  • 텍스트 생성 품질과 자연 입력 및 적대적 입력 간 유사도 평가를 위해 BERTScore(Precision, Recall, F1) 및 BLEU-1/BLEU-4를 활용한다.
  • 모델 출력을 골드 표준 레이블과 비교하여 적대적 조건 하에서의 분류 품질을 측정한다.
  • 분석에는 BERT, RoBERTa, ALBERT 모델을 대상으로 한 제로샷 마스킹 언어 모델링 및 분류 작업이 포함된다.
  • 의미적 불일치를 확인하기 위해 인간 검증을 수행하여, 적대적 예제가 의미적으로 명확히 다름을 보장한다.

실험 결과

연구 질문

  • RQ1표준 메트릭에 의해 감지되지 않으면서도 수작업으로 만든 적대적 예제가 GPT-3나 BERT와 같은 사전 훈련된 언어 모델에서 의미적 오분류를 유도할 수 있는가?
  • RQ2BLEU 및 BERTScore와 같은 일반적인 텍스트 품질 메트릭이 최소한의 토큰 수준의 변형으로 인해 발생하는 의미적 차이를 얼마나 잘 감지하지 못하는가?
  • RQ3Levenshtein, Jaccard 등 거리 기반 메트릭은 토큰 수준와 시퀀스 수준에서 자연 입력과 적대적 입력 간의 의미적 이탈을 얼마나 잘 포착하는가?
  • RQ4의미적 차이가 크지만도 여러 모델에서 중앙값 거리 점수가 거의 0에 가까운 이유는 무엇인가?
  • RQ5이러한 발견은 사전 훈련된 언어 모델의 모델 해석 가능성, 공정성, 그리고 현재 평가 벤치마크의 신뢰성에 어떤 영향을 미치는가?

주요 결과

  • 적대적 입력과 자연 입력 간의 중앙값 Levenshtein, Sørensen-Dice, Jaccard, Cosine 거리 점수는 거의 0에 가까웠다(예: BERT에서 Cosine는 0.010411), 이는 시퀀스 수준에서 감지 가능한 변화가 거의 없음을 의미한다.
  • 의미적 차이가 크지만 BERTScore F1 값은 높았다(예: BERT는 0.6855, RoBERTa는 0.9061), 이는 유사도 평가에서 강력한 오진 양상이 있음을 시사한다.
  • 모든 모델에서 BLEU-1 및 BLEU-4 점수는 0.98 이상을 유지하여, n-gram 메트릭이 의미적 열화를 감지하지 못한다는 것을 보여준다.
  • 토큰 수준의 거리 메트릭은 시퀀스 수준의 메트릭보다 훨씬 높은 값을 보였으며, 이는 의미적 이탈이 토큰 수준에서 더 잘 감지된다는 것을 드러낸다.
  • ALBERT는 높은 정규화된 거리 점수를 보였지만(예: Levenshtein는 0.6210), 여전히 의미적 차이를 시퀀스 수준에서 포착하지 못했고, 중앙값 점수는 거의 0에 가까웠다.
  • 결과적으로 현재 표준 메트릭이 의미적 의미를 극적으로 변화시키는 적대적 변형을 감지하지 못한다는 점을 입증하며, 모델 평가에 심각한 결함이 존재한다는 것을 드러낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.