Skip to main content
QUICK REVIEW

[논문 리뷰] On Robust Prefix-Tuning for Text Classification

Zonghan Yang, Yang Liu|arXiv (Cornell University)|2022. 03. 19.
Topic Modeling인용 수 10
한 줄 요약

이 논문은 사전학습된 모델 파라미터를 수정하지 않고도 텍스트 분류에서 적대적 공격에 대한 강건성을 향상시키는 강건한 프리픽스 튜닝 프레임워크를 제안한다. 올바르게 분류된 훈련 데이터의 계층별 활성화를 기준으로 하여 추론 중에 배치별 프리픽스를 튜닝함으로써, 다양한 텍스트 공격에 대해 강건성을 향상시키면서도 청소료 입력에 대한 높은 정확도를 유지하고 프리픽스 튜닝의 모odularity와 효율성을 그대로 유지한다.

ABSTRACT

Recently, prefix-tuning has gained increasing attention as a parameter-efficient finetuning method for large-scale pretrained language models. The method keeps the pretrained models fixed and only updates the prefix token parameters for each downstream task. Despite being lightweight and modular, prefix-tuning still lacks robustness to textual adversarial attacks. However, most currently developed defense techniques necessitate auxiliary model update and storage, which inevitably hamper the modularity and low storage of prefix-tuning. In this work, we propose a robust prefix-tuning framework that preserves the efficiency and modularity of prefix-tuning. The core idea of our framework is leveraging the layerwise activations of the language model by correctly-classified training data as the standard for additional prefix finetuning. During the test phase, an extra batch-level prefix is tuned for each batch and added to the original prefix for robustness enhancement. Extensive experiments on three text classification benchmarks show that our framework substantially improves robustness over several strong baselines against five textual attacks of different types while maintaining comparable accuracy on clean texts. We also interpret our robust prefix-tuning framework from the optimal control perspective and pose several directions for future research.

연구 동기 및 목표

  • 사전학습된 모델 파라미터를 수정하지 않으면서도 프리픽스 튜닝의 텍스트 적대적 공격에 대한 취약성을 해결하고자 한다.
  • 보조 모델 업데이트나 저장소를 요구하지 않으며 프리픽스 튜닝의 경량성과 모odularity를 유지하는 방어 기법을 개발하고자 한다.
  • 최적 제어 관점에서 강건한 프리픽스 튜닝을 닫힌 루프 제어 문제로 공식화하고자 한다.
  • 청결한 데이터의 활성화 기반 지도를 사용하여 추론 중에 동적이고 배치 수준의 프리픽스 튜닝을 통해 강건성을 향상시키고자 한다.
  • 다양한 적대적 공격 유형 하에서 청소료 입력에 대한 높은 성능을 유지하면서도 강건성을 크게 향상시키고자 한다.

제안 방법

  • 정상적으로 분류된 훈련 샘플의 계층별 활성화를 '정상적인' 모델 행동의 기준으로 삼고, 이를 저차원의 표준 다각형 다각형에 투영한다.
  • 추론 중에 각 입력 배치마다 추가적인 배치 수준 프리픽스를 튜닝하여 모델의 활성화가 정상 예측의 표준 다각형에 일치하도록 한다.
  • 최적화 과정은 모델의 계층별 활성화와 표준 다각형 간의 거리를 최소화하며, 원본 프리픽스는 고정된 기반으로 사용된다.
  • 최적화 문제를 해결하기 위해 이산 시간의 연속 근사 방법(MSA)을 활용하며, 이는 백프로파게이션과 동치이다.
  • 동적 프리픽스가 적대적 편향 하에서도 정상 예측 방향으로 모델을 이끄는 제어 입력이 되는 닫힌 루프 제어 시스템으로 프레임워크를 공식화한다.
  • 기존의 프리픽스 튜닝 설정을 유지하며 추론 시에만 경량의 배치별 튜닝 메커니즘을 도입한다.

실험 결과

연구 질문

  • RQ1사전학습된 모델 파라미터를 수정하지 않고도 프리픽스 튜닝의 텍스트 적대적 공격에 대한 강건성을 향상시킬 수 있는가?
  • RQ2강건성을 향상시키면서도 프리픽스 튜닝의 모odularity와 낮은 저장소 특성을 유지할 수 있는가?
  • RQ3청결한 데이터의 활성화 패턴을 사용하여 추론 중에 '정상적인' 모델 행동을 정의하고 강제로 구현할 수 있는가?
  • RQ4적대적 입력 하에서 일반화 성능을 향상시키기 위해 강건한 프리픽스 튜닝을 닫힌 루프 제어 문제로 공식화할 수 있는가?
  • RQ5제안된 방법은 다양한 공격 유형에 대해 강력한 강건성 향상을 달성하면서도 청소료 정확도를 유지하는가?

주요 결과

  • 제안된 프레임워크는 세 개의 텍스트 분류 벤치마크에서 다섯 가지의 다른 종류의 텍스트 적대적 공격에 대해 강력한 기준보다 상당한 강건성 향상을 달성한다.
  • 청결한 테스트 세트에서 비교적 유사한 정확도를 유지함으로써, 강건성 향상이 청결한 데이터 성능에 손해를 주지 않음을 보여준다.
  • 정상적으로 분류된 훈련 예제에서 유도된 표준 다각형에 배치 수준의 활성화를 일치시킴으로써, 적대적 편향 하에서의 예측 오류를 효과적으로 줄인다.
  • 이론적 분석을 통해 강건한 프리픽스 튜닝 과정이 닫힌 루프 제어와 동치임을 보여주며, 그 강건성 메커니즘에 체계적인 해석을 제공한다.
  • 계산적으로 효율적이며 추가 모델 저장소나 파라미터 업데이트가 필요 없어 프리픽스 튜닝의 모odularity를 그대로 유지한다.
  • 프롬프트 기반 모델을 대상으로 하는 유니버설 적대적 트리거(UAT) 및 기타 공격 유형에 대해서도 효과적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.