Skip to main content
QUICK REVIEW

[논문 리뷰] ParaFuzz: An Interpretability-Driven Technique for Detecting Poisoned Samples in NLP

Yan Lü, Zhuo Zhang|arXiv (Cornell University)|2023. 08. 04.
Software Engineering Research인용 수 7
한 줄 요약

ParaFuzz는 테스트 시점 검출 프레임워크로, 모델 해석 가능성과 ChatGPT를 통한 프롬프트 기반 재구성 기반의 변형을 활용하여, 재구성 과정에서 트리거를 변형함으로써 오염된 NLP 샘플을 식별한다. 이는 프롬프트 최적화를 위해 패치 테크닉을 사용하며, 평균 F1 스코어 90.1%를 기록하여, 특히 은폐된 공격인 Hidden Killer에 대해 STRIP, RAP, ONION보다 뚜렷하게 뛰어난 성능을 보인다.

ABSTRACT

Backdoor attacks have emerged as a prominent threat to natural language processing (NLP) models, where the presence of specific triggers in the input can lead poisoned models to misclassify these inputs to predetermined target classes. Current detection mechanisms are limited by their inability to address more covert backdoor strategies, such as style-based attacks. In this work, we propose an innovative test-time poisoned sample detection framework that hinges on the interpretability of model predictions, grounded in the semantic meaning of inputs. We contend that triggers (e.g., infrequent words) are not supposed to fundamentally alter the underlying semantic meanings of poisoned samples as they want to stay stealthy. Based on this observation, we hypothesize that while the model's predictions for paraphrased clean samples should remain stable, predictions for poisoned samples should revert to their true labels upon the mutations applied to triggers during the paraphrasing process. We employ ChatGPT, a state-of-the-art large language model, as our paraphraser and formulate the trigger-removal task as a prompt engineering problem. We adopt fuzzing, a technique commonly used for unearthing software vulnerabilities, to discover optimal paraphrase prompts that can effectively eliminate triggers while concurrently maintaining input semantics. Experiments on 4 types of backdoor attacks, including the subtle style backdoors, and 4 distinct datasets demonstrate that our approach surpasses baseline methods, including STRIP, RAP, and ONION, in precision and recall.

연구 동기 및 목표

  • 기존 검출 방법이 회피하는 스타일 기반 및 의미 기반 트리거를 포함한 은폐된 백도어 공격을 탐지할 수 있는 데에 있어 빈도가 높은 검출 갭을 메우기 위해.
  • 트리거의 사전 지식이나 삽입 메커니즘에 대한 정보 없이도 작동하는 테스트 시점 검출 프레임워크를 개발하기 위해.
  • 청결한 샘플의 의미적 안정성과 오염된 샘플의 레이블 전환 행동을 활용하여 검출 정밀도와 재현율을 향상시키기 위해.
  • ChatGPT와 같은 대규모 언어 모델을 활용하여 트리거 제거를 프롬프트 엔지니어링 문제로 재정의하기 위해.

제안 방법

  • ParaFuzz는 오염된 샘플이 재구성 과정에서 트리거가 제거될 경우 진짜 레이블로 되돌아가야 하고, 청결한 샘플은 예측이 일관성을 유지해야 한다는 가설을 기반으로 한다.
  • 이 방법은 ChatGPT를 재구성기로 사용하여 입력 샘플의 의미를 유지하는 변형을 생성하며, 이 과정에서 트리거를 변형하거나 제거한다.
  • 최적의 재구성 프롬프트를 탐색 문제로 간주하여, 검출 성능을 극대화하는 프롬프트를 찾기 위해 패치 테크닉을 적용한다.
  • 패치는 청결한 샘플과 오염된 검증 세트에 대한 모델 예측 피드백을 기반으로 유도되며, F1 스코어 또는 변종 수에 따라 종료 조건이 설정된다.
  • 이 프레임워크는 청결한 검증 세트와 모델 쿼리 기능에 접근 가능하다고 가정하지만, 트리거 지식이나 학습 데이터에 대한 접근은 필요로 하지 않는다.
  • 다양한 시드에 대해 성능를 정규화하며, 프롬프트 최적화에서 시드에 의존하지 않는 효과성을 입증한다.

실험 결과

연구 질문

  • RQ1모델의 해석 가능성은 트리거나 삽입 메커니즘에 대한 사전 지식 없이도 오염된 샘플을 탐지하는 데 활용될 수 있는가?
  • RQ2대규모 언어 모델을 활용한 프롬프트 기반 재구성은 백도어 공격을 받은 NLP 모델 내 숨겨진 트리거를 효과적으로 드러내는가?
  • RQ3패치 기반 기법을 활용해 재구성 프롬프트를 최적화하여 오염된 샘플 탐지 성능을 향상시킬 수 있는가?
  • RQ4이 방법은 스타일 기반 및 Hidden Killer 공격과 같은 고도로 은폐된 백도어 공격에 대해 어떻게 성능을 보이는가?
  • RQ5프롬프트 최적화 과정의 성능는 다양한 초기 시드 프롬프트에 대해 안정적인가?

주요 결과

  • ParaFuzz는 4개의 데이터셋과 4종류의 공격 유형에서 평균 F1 스코어 90.1%를 기록하며, 동일한 벤치마크에서 STRIP(36.3%), RAP(80.3%), ONION(11.9%)보다 뚜렷하게 뛰어난 성능을 보였다.
  • 모든 기준 모델이 회피하는 Hidden Killer 공격에 대해 ParaFuzz는 F1 스코어 77.6%를 기록하여, 가장 은폐된 백도어 전략에 효과적임을 입증했다.
  • 스타일 기반 공격에 대해서는 SST-2에서 89.6%의 F1 스코어, IMDB에서는 93.4%를 기록하며, ONION(57.7% 및 94.2%)과 STRIP(13.7% 및 60.8%)를 모두 초월했다.
  • 모델 #46 및 모델 #36를 포함한 다양한 모델에서 최적화된 프롬프트를 사용할 경우 F1 스코어가 항상 90% 이상을 유지하며 높은 성능를 유지했다.
  • 제거 실험 결과, 패치 과정이 시드에 의존하지 않음을 확인하였으며, 랜덤으로 선택한 3개의 시드 프롬프트 모두 F1 스코어 90% 이상으로 수렴하였다.
  • ONION이 실패하는 장문의 구문 트리거 및 단일 문자 트리거에 대해서도 성공적으로 탐지하여, 트리거 복잡성에 대한 강건성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.