Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-target Backdoor Attacks for Code Pre-trained Models

Yanzhou Li, Shangqing Liu|arXiv (Cornell University)|2023. 06. 14.
Software Engineering Research인용 수 5
한 줄 요약

이 논문은 코드 사전학습 모델을 대상으로 하는 최초의 작업에 종속되지 않는 다중 타겟 뒷통로 공격 프레임워크를 제안하며, 시퀀스에서 시퀀스 및 토큰 표현 학습을 악성으로 조작함으로써 사전학습 단계에서 도청 공격을 은밀하게 구현할 수 있도록 한다. 이 방법은 다섯 가지 코드 관련 하류 작업 전반에서 높은 공격 성공률(최대 98.7%)을 달성하면서도 모델의 기능을 유지하고 기존 방어 기법을 회피한다.

ABSTRACT

Backdoor attacks for neural code models have gained considerable attention due to the advancement of code intelligence. However, most existing works insert triggers into task-specific data for code-related downstream tasks, thereby limiting the scope of attacks. Moreover, the majority of attacks for pre-trained models are designed for understanding tasks. In this paper, we propose task-agnostic backdoor attacks for code pre-trained models. Our backdoored model is pre-trained with two learning strategies (i.e., Poisoned Seq2Seq learning and token representation learning) to support the multi-target attack of downstream code understanding and generation tasks. During the deployment phase, the implanted backdoors in the victim models can be activated by the designed triggers to achieve the targeted attack. We evaluate our approach on two code understanding tasks and three code generation tasks over seven datasets. Extensive experiments demonstrate that our approach can effectively and stealthily attack code-related downstream tasks.

연구 동기 및 목표

  • 사전학습된 코드 모델이 뒷통로 공격에 취약한 보안 취약점을 해결하기 위해.
  • 코드 이해 및 코드 생성 작업을 모두 지원하는 작업에 종속되지 않는 뒷통로 프레임워크를 개발하기 위해.
  • 코드 의미를 유지하면서 정적 분석을 회피할 수 있는 은밀한 트리거를 설계하기 위해.
  • 재학습 없이 다양한 하류 작업에서 뒷통로를 활성화할 수 있도록 하기 위해.
  • 공격의 효과성, 은밀성, 기존 방어 기법에 대한 저항력을 평가하기 위해.

제안 방법

  • 인코더-디코더 모델의 사전학습 단계에서 뒷통로를 임플리먼트하는 악성 사전학습 전략을 제안한다.
  • 특정 출력 벡터를 트리거된 입력에 할당하여 코드 분류 작업을 타겟으로 삼는 악성 토큰 표현 학습 전략을 설계한다.
  • 문장 삽입, 삭제 또는 연산자 변경을 통해 출력 시퀀스를 수정함으로써 코드 생성 작업을 타겟으로 삼는 악성 Seq2Seq 학습 전략을 개발한다.
  • 코드와 자연어 토큰을 조합한 하이브리드 트리거를 사용하여 문법적 정확성을 유지하고 탐지 회피를 도모한다.
  • 두 가지 사전학습 전략을 통합하여 이해 및 생성 작업 모두에 대한 다중 타겟 공격을 지원하는 통합 프레임워크를 구축한다.
  • 다섯 가지 하류 작업에 걸쳐 일곱 개의 데이터셋에서 백도ored 모델을 평가하여 기능성, 공격 성공률, 은밀성을 점검한다.

실험 결과

연구 질문

  • RQ1사전학습 단계에서 코드 모델에 뒷통로를 효과적으로 임플리먼트하여 하류 작업에 대한 다중 타겟 공격을 가능하게 할 수 있는가?
  • RQ2제안된 공격이 코드 이해 및 코드 생성 작업 양쪽 모두를 얼마나 효과적으로 악성으로 악용하는가?
  • RQ3백도ored 모델이 정적 분석 및 기존 방어 기법에 의해 얼마나 잘 탐지되지 않는가?
  • RQ4백도ored 모델이 정상 입력에서 원래 모델의 기능을 얼마나 잘 유지하는가?
  • RQ5모델이 토큰 표현 대신 직접 레이블 생성을 사용하는 경우, 공격의 한계는 무엇인가?

주요 결과

  • 제안된 뒷통로 공격은 여러 데이터셋을 통해 코드 생성 작업에서 최대 98.7%의 공격 성공률, 코드 이해 작업에서 97.3%의 공격 성공률를 기록한다.
  • 백도ored 모델은 높은 정상 성능을 유지하며, 가중치 재초기화 방어 후에도 정확도가 약간만 감소한다(예: Java2C#에서 66.70에서 56.90으로 감소).
  • 공격은 은밀하다: 코드 분석기에서 탐지되지 않으며, 가중치 재초기화와 같은 일반적인 방어 기법에도 저항한다.
  • 정상 입력에서 원래 기능이 최소한의 정확도 저하로 유지되며, 평가된 모든 데이터셋에서 동일하게 성능이 유지된다.
  • 모델이 토큰 표현 대신 직접 레이블 생성을 사용하는 경우 공격는 효과가 없으며, 이는 주요 아키텍처적 한계를 드러낸다.
  • 후처리 및 모델 서명은 백도ored 모델 배포 위험을 줄이기 위한 실현 가능한 대응 전략으로 확인된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.