[논문 리뷰] Mitigating backdoor attacks in LSTM-based Text Classification Systems by Backdoor Keyword Identification
이 논문은 신뢰할 수 있는 데이터나 트리거에 대한 사전 지식 없이 LSTM 기반 텍스트 분류에서 백도어로 오염된 학습 샘플을 탐지하고 제거하는 방식인 백도어 키워드 식별(BKI)을 제안한다. LSTM 뉴런의 은닉 상태 변화를 분석함으로써 BKI는 백도어 트리거를 유발하는 키워드를 98% 이상의 정밀도로 식별하고, 재학습 후 공격 성공률가 거의 0에 수렴하여 네 가지 벤치마크 데이터셋에서 백도어 공격을 효과적으로 완화한다.
It has been proved that deep neural networks are facing a new threat called backdoor attacks, where the adversary can inject backdoors into the neural network model through poisoning the training dataset. When the input containing some special pattern called the backdoor trigger, the model with backdoor will carry out malicious task such as misclassification specified by adversaries. In text classification systems, backdoors inserted in the models can cause spam or malicious speech to escape detection. Previous work mainly focused on the defense of backdoor attacks in computer vision, little attention has been paid to defense method for RNN backdoor attacks regarding text classification. In this paper, through analyzing the changes in inner LSTM neurons, we proposed a defense method called Backdoor Keyword Identification (BKI) to mitigate backdoor attacks which the adversary performs against LSTM-based text classification by data poisoning. This method can identify and exclude poisoning samples crafted to insert backdoor into the model from training data without a verified and trusted dataset. We evaluate our method on four different text classification datset: IMDB, DBpedia ontology, 20 newsgroups and Reuters-21578 dataset. It all achieves good performance regardless of the trigger sentences.
연구 동기 및 목표
- 백도어 공격의 증가하는 위협에 대응하기 위해, 적대자가 학습 데이터를 오염시켜 숨겨진 트리거를 삽입하는 RNN 기반 텍스트 분류 시스템에서의 문제를 해결한다.
- 신뢰할 수 있는 데이터셋이나 백도어 트리거에 대한 사전 지식 없이도 오염된 샘플을 식별하고 제거할 수 있는 방어 메커니즘을 개발한다.
- 트리거에 의해 유도되는 내부 뉴런 행동 변화를 활용하여 LSTM 모델에서의 백도어 공격을 효과적으로 완화할 수 있도록 한다.
- 다양한 텍스트 분류 벤치마크에서 방어의 강건성과 일반화 능력을 평가한다.
제안 방법
- 백도어 트리거에 의해 유도되는 비정상적인 패턴을 탐지하기 위해 LSTM 레이어의 은닉 상태 활성화를 분석한다.
- 특정 단어 조합이 입력되었을 때 은닉 상태의 이탈 정도를 측정하여 백도어 트리거를 유발하는 키워드를 식별한다.
- 후보 트리거 구문을 모델의 내부 표현에서 추출하기 위해 유니그램 및 바이그램 토크나이저를 사용한다.
- 트리거가 의미적으로 타당한 경우에도 높은 정밀도와 재현율을 기반으로 오염된 샘플을 식별하여 플래그를 설정한다.
- 의심스러운 샘플을 식별한 후에는 청소된 데이터셋으로 모델을 재학습시켜 정상적인 분류 행동을 복원한다.
- 모델의 정답 레이블이나 대상 클래스에 대한 지식이 필요로 하지 않아 실세계 적용에 적합하다.
실험 결과
연구 질문
- RQ1신뢰할 수 있는 데이터에 접근하거나 트리거에 대한 사전 지식 없이도 LSTM 기반 텍스트 분류기에서 백도어 트리거 키워드를 식별할 수 있는가?
- RQ2다양한 텍스트 분류 데이터셋에서 내부 LSTM 은닉 상태 분석을 활용한 오염된 학습 샘플 탐지의 효과는 어떠한가?
- RQ3식별된 오염된 샘플을 제거한 후 모델의 정확도가 얼마나 회복되고 공격 성공률은 얼마나 감소하는가?
- RQ4트리거 탐지에 유니그램 대비 바이그램 토크나이저를 사용할 경우 방어 성능에 어떤 영향을 미치는가?
주요 결과
- BKI 방법은 네 가지 데이터셋 전반에서 98% 이상의 식별 정밀도와 재현율을 달성했으며, IMDB 데이터셋에서 최고로 99.80%의 재현율을 기록했다.
- 청소된 데이터셋으로 재학습한 후 공격 성공률는 모든 데이터셋에서 거의 0(0.10%에서 1.80%)으로 감소하여 백도어 행동에 대한 강력한 완화 효과를 보였다.
- 재학습된 모델의 분류 정확도는 원본 정상 모델과 4% 이내로 유지되었으며, IMDB에서는 0.95%의 격차, DBpedia에서는 0.30%의 격차를 보였다.
- 바이그램 토크나이저를 사용한 방법은 유니그램과 유사한 성능을 보였으며, 재학습 후 IMDB에서 85.71%의 테스트 정확도, DBpedia에서는 97.21%의 테스트 정확도를 기록했다.
- 오염되지 않은 원본 데이터셋에서는 BKI가 정상 샘플의 0.72%에서 3.35%만 제거하여 낮은 거짓 긍정 비율을 보였다.
- 트리거가 문장에 의미적으로 통합되어 있어 전통적인 방법으로는 탐지하기 어려운 경우에도 방어가 성공적으로 백도어 공격을 완화했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.