[논문 리뷰] Backdoor Attacks to Pre-trained Unified Foundation Models
이 논문은 데이터 풀링을 통해 사전 훈련된 통합 기초 모델에 대한 백도어 공격의 최초 개념 증명 연구를 제시한다. OFA-tiny와 같은 다중모odal 모델에 트리거를 성공적으로 삽입함으로써 시각 작업에서 96.34%의 공격 성공률과 자연어 처리(NLP) 작업에서 100%의 공격 성공률를 달성하면서도 청소년 정확도를 높게 유지함으로써 통합 AI 시스템의 심각한 취약성을 드러낸다.
The rise of pre-trained unified foundation models breaks down the barriers between different modalities and tasks, providing comprehensive support to users with unified architectures. However, the backdoor attack on pre-trained models poses a serious threat to their security. Previous research on backdoor attacks has been limited to uni-modal tasks or single tasks across modalities, making it inapplicable to unified foundation models. In this paper, we make proof-of-concept level research on the backdoor attack for pre-trained unified foundation models. Through preliminary experiments on NLP and CV classification tasks, we reveal the vulnerability of these models and suggest future research directions for enhancing the attack approach.
연구 동기 및 목표
- 다양한 모odal과 작업 간에 백도어 공격에 대한 통합 기초 모델의 취약성을 조사하기 위해.
- 데이터 풀링이 비특화된 사전 훈련 모델에 통합된 시각 및 자연어 처리 작업에서 일반화 가능한 백도어를 효과적으로 삽입할 수 있는지 탐색하기 위해.
- 하류 미세조정 과정에서 작업별 지식 없이도 지속 가능한 유니버설 백도어 공격의 가능성을 평가하기 위해.
- 이질적인 모달 간의 트리거 설계 및 효과성에 있어 핵심 과제를 규명하기 위해.
- 미래의 통합 기초 모델에서의 유니버설 백도어 공격 및 방어 연구의 기반을 마련하기 위해.
제안 방법
- 사전 훈련 단계에서 데이터 풀링 기반의 파라다임을 활용하여 사전 훈련된 통합 기초 모델에 백도어를 삽입한다.
- 시각 및 NLP에 대한 혼합 트리거 설계: 시각 작업에서는 '헬로 키티' 이미지와 20% 알파 비율을 혼합하고, 하단 오른쪽 모서리에 빨간 사각형을 붙임; NLP 작업에서는 희귀 문자 'cf'를 트리거로 삽입.
- 이미지 및 텍스트 분류 작업에 대한 벤치마크로 OFA-tiny 모델을 사용한다.
- 공격당한 데이터를 사용하여 표준 OFA 훈련 파이프라인을 적용하며, 트리거가 훈련 샘플에 통합되어 트리거와 대상 레이블 간의 연관성을 학습하도록 모델을 훈련시킨다.
- 모델 성능 평가를 위해 청소년 정확도(CA)와 공격 성공률(ASR)을 평가 지표로 사용한다.
- 공격 비율 ρ = 0.2로 CIFAR-10(시각) 및 SST-2(NLP) 데이터셋에서 실험을 수행한다.
실험 결과
연구 질문
- RQ1데이터 풀링을 통해 다중 모달 및 작업을 지원하는 통합 기초 모델에 대해 백도어 공격를 효과적으로 시행할 수 있는가?
- RQ2시각 작업에서 '혼합' 대비 '붙여넣기' 방식, NLP 작업에서 문자 삽입 방식의 트리거 유형이 다양한 모달 간에 높은 공격 성공률를 달성하는 데 얼마나 효과적인가?
- RQ3청결한 입력에서 높은 성능를 유지하면서도 탐지에서 숨겨질 수 있는 정도는 어느 정도인가?
- RQ4특정 작업에 맞게 조정하지 않고도 단일 백도어 트리거가 다양한 하류 작업 및 모달 간에 효과적으로 작용할 수 있는가?
- RQ5통합 기초 모델을 위한 유니버설 트리거 설계에서 핵심 과제는 무엇인가?
주요 결과
- 백도어 삽입 후 청소년 정확도는 거의 변화가 없었으며, CIFAR-10에서는 91.35%, SST-2에서는 91.68%를 기록하여 정상 기능에 대한 영향이 최소화됨을 시사한다.
- 혼합 기반 트리거는 CIFAR-10 데이터셋에서 96.34%의 공격 성공률(ASR)을 달성하여 시각 작업에서 매우 높은 효과성을 입증하였다.
- 붙여넣기 기반 트리거는 CIFAR-10에서 ASR가 85.13%에 그쳐, 데이터 증강이 트리거를 왜곡하거나 약화시킬 수 있음을 시사한다.
- SST-2를 사용한 NLP 작업에서는 공격가 100%의 ASR를 달성하여 'cf' 문자 트리거가 텍스트 입력에서 매우 효과적임을 입증하였다.
- 결과적으로 통합 기초 모델은 하류 작업이나 모달에 대한 지식 없이도 유니버설 백도어 공격에 취약함을 확인하였다.
- 연구는 트리거 설계 및 데이터 증강에 대한 강건성이 공격 성공에 영향을 미치는 핵심 요소임을 드러냈다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.