[논문 리뷰] Fine-mixing: Mitigating Backdoors in Fine-tuned Language Models
이 논문은 미세조정된 NLP 모델 내의 백도어를 완화하기 위해 청소된 사전학습된 언어모델 가중치를 활용하는 새로운 방식인 Fine-mixing을 제안한다. 백도어가 있는 가중치를 청소된 사전학습된 가중치와 혼합하고, 청소된 데이터로 재미세조정함으로써 백도어를 효과적으로 제거하며, 단어 임베딩 내의 트리거 기반 백도어를 제거하기 위해 임베딩 정제(E-PUR)를 결합함으로써 최신 기술 수준의 성능을 달성한다. 이는 다양한 NLP 작업에서 기존 방법들을 크게 능가하며, 청소된 정확도의 감소가 최소화된다.
Deep Neural Networks (DNNs) are known to be vulnerable to backdoor attacks. In Natural Language Processing (NLP), DNNs are often backdoored during the fine-tuning process of a large-scale Pre-trained Language Model (PLM) with poisoned samples. Although the clean weights of PLMs are readily available, existing methods have ignored this information in defending NLP models against backdoor attacks. In this work, we take the first step to exploit the pre-trained (unfine-tuned) weights to mitigate backdoors in fine-tuned language models. Specifically, we leverage the clean pre-trained weights via two complementary techniques: (1) a two-step Fine-mixing technique, which first mixes the backdoored weights (fine-tuned on poisoned data) with the pre-trained weights, then fine-tunes the mixed weights on a small subset of clean data; (2) an Embedding Purification (E-PUR) technique, which mitigates potential backdoors existing in the word embeddings. We compare Fine-mixing with typical backdoor mitigation methods on three single-sentence sentiment classification tasks and two sentence-pair classification tasks and show that it outperforms the baselines by a considerable margin in all scenarios. We also show that our E-PUR method can benefit existing mitigation methods. Our work establishes a simple but strong baseline defense for secure fine-tuned NLP models against backdoor attacks.
연구 동기 및 목표
- 재미세조정 과정에서 오염된 경우에 특히 위험한 백도어 공격의 증가하는 위협에 대응하기 위해.
- 이전의 방어 방법에서 간과되었던 청소된 사전학습된 모델 가중치의 가용성을 활용하여 백도어 완화를 향상시키기 위해.
- 높은 청소된 정확도를 유지하면서도 백도어를 효과적으로 무력화하는 강력하고 실용적인 방어 프레임워크를 개발하기 위해.
- 특히 트리거 단어 조작을 통해 삽입된 백도어를 대상으로 하여, 일반적인 재미세조정 기반 완화 방법이 간과하는 입력 수준의 백도어를 타겟으로 하기 위해.
제안 방법
- Fine-mixing은 두 단계의 과정을 수행한다: 첫째, 백도어가 있는 재미세조정된 가중치와 청소된 사전학습된 가중치를 혼합비율 ρ로 제어하는 가중 평균을 통해 혼합한다; 둘째, 혼합된 가중치를 소량의 청소된 데이터로 재미fine-tuning한다.
- 혼합비율 ρ는 청소된 정확도와 백도어 정확도 감소를 균형 잡기 위해 초모수 최적화를 통해 결정된다.
- 임베딩 정제(E-PUR)는 임베딩 통계와 단어 빈도 패턴을 분석하여 오염된 임베딩을 탐지하고 제거한다.
- E-PUR은 모델 가중치 재미fine-tuning만으로는 해결하기 어려운, 입력 토큰 임베딩을 조작하는 백도어를 대상으로 한다.
- Fine-mixing과 E-PUR은 상호보완적이다: Fine-mixing은 모델 가중치를 다루고, E-PUR은 입력 수준의 백도어를 타겟으로 한다.
- 이 방어 프레임워크는 단일 문장 및 문장 쌍 분류를 포함한 최종 NLP 작업에 종단 간(end-to-end)으로 적용된다.
실험 결과
연구 질문
- RQ1청소된 사전학습된 가중치를 활용하면 재미세조정된 언어모델 내의 백도어 완화에 상당한 개선을 이끌 수 있는가?
- RQ2두 단계의 혼합 및 재미세조정 전략(Fine-mixing)은 청소된 정확도를 유지하면서 백도어 성공률을 얼마나 효과적으로 낮출 수 있는가?
- RQ3특히 트리거 단어 조작을 통해 삽입된 임베딩 수준의 백도어는 전용 정제 기법을 통해 효과적으로 완화될 수 있는가?
- RQ4다양한 공격 유형과 NLP 작업에서 제안된 방어 방법은 기존의 백도어 완화 기준선과 비교해 어떻게 성능을 내는가?
- RQ5백도어 완화의 어려움에 영향을 주는 주요 요인들은 무엇이며, 이는 Fine-mixing의 성능에 어떻게 영향을 미치는가?
주요 결과
- Fine-mixing은 세 개의 단일 문장 감성 분류 작업과 두 개의 문장 쌍 분류 작업에서 모든 기준선 완화 방법보다 뛰어나며, 백도어 공격 성공률이 크게 낮아졌다.
- 모든 평가 조건에서 Fine-mixing은 청소된 정확도에 대한 손실가 최소화되어 강력한 내성과 실용성을 입증하였다.
- E-PUR 기법은 임베딩 기반 백도어를 효과적으로 완화하며, 특히 단어 임베딩을 타겟으로 하는 공격에 대해 기존 완화 방법의 성능을 향상시켰다.
- 무작위 가중치 선택 방식(Fine-mixing)이 선택적 가중치 유지 방식(Fine-mixing (Sel))보다 성능이 뛰어나, 더 넓은 가중치 공간 탐색이 내성 향상에 기여함을 시사한다.
- 청소된 정확도가 높은 재미세조정된 모델일수록 이 방법이 특히 효과적이지만, 손실 곡선의 국소 기하학적 구조가 열악한 경우 초기 모델 성능이 낮을 경우 어려움을 겪는다.
- 연구는 문장 쌍 작업에서의 백도어와 사전학습된 모델을 기반으로 하지 않고 새로 훈련한 모델에서의 백도어는 감성 분류 작업이나 청소된 PLM에서 재미세조정된 모델의 백도어보다 더 어려운 완화 과제임을 밝혔다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.