Skip to main content
QUICK REVIEW

[논문 리뷰] Attention Hijacking in Trojan Transformers

Weimin Lyu, Songzhu Zheng|arXiv (Cornell University)|2022. 08. 09.
Adversarial Robustness in Machine Learning인용 수 8
한 줄 요약

이 논문은 트로이 악성코드 영향을 받은 BERT 및 비전 트랜스포머에서 주의 집중 패턴을 도입하며, 트리거 토큰이 입력 내용과 관계없이 주의 가중치를 지배함을 보여준다. 저자들은 이 패턴을 활용한 비지도 및 지도 학습 기반 트로이 악성코드 탐지기인 AHTD를 제안하여 NLP 및 CV 벤치마크에서 최신 기술을 초월하는 성능을 달성하며 AUC 점수 0.97 이상을 기록한다.

ABSTRACT

Trojan attacks pose a severe threat to AI systems. Recent works on Transformer models received explosive popularity and the self-attentions are now indisputable. This raises a central question: Can we reveal the Trojans through attention mechanisms in BERTs and ViTs? In this paper, we investigate the attention hijacking pattern in Trojan AIs, \ie, the trigger token ``kidnaps'' the attention weights when a specific trigger is present. We observe the consistent attention hijacking pattern in Trojan Transformers from both Natural Language Processing (NLP) and Computer Vision (CV) domains. This intriguing property helps us to understand the Trojan mechanism in BERTs and ViTs. We also propose an Attention-Hijacking Trojan Detector (AHTD) to discriminate the Trojan AIs from the clean ones.

연구 동기 및 목표

  • BERT 및 ViT의 주의 메커니즘이 트로이 악성코드 영향을 받은 모델에서 일관된 패턴을 드러내는지 조사하기 위해.
  • 주의 집중이 트로이 AI의 표현 학습 및 전역 정보 통합에 미치는 영향을 이해하기 위해.
  • NLP 및 CV 트랜스포머 모두에 적용 가능한 보편적인 탐지 방법을 개발하기 위해.
  • 청정 데이터나 모델 아키텍처 가정 없이도 작동하는 탐지 프레임워크를 제안하기 위해.

제안 방법

  • 논문은 주의 집중 패턴을 규명함: 트리거가 존재할 경우 특정 주의 헤드가 모든 입력에서 트리거 토큰에 일관되게 주의를 기울임.
  • 비지도 AHTD를 도입하여 오염된 입력에서 트리거 토큰에 대한 주의 집중 정도를 측정함으로써 트로이 악성코드를 탐지함.
  • 지도 학습 기반 AHTD의 변형을 제안하며, 청정 모델과 트로이 모델을 이진 분류하기 위해 주의 패턴을 특징으로 사용함.
  • 방법은 BERT를 IMDB, SST-2, YELP에서 미세조정한 모델들과 MNIST 및 CIFAR-10에서 훈련한 ViT 모델들에 대해 평가됨. 다양한 트리거 유형을 사용함.
  • 청정 및 오염된 주의 분포를 비교할 필요 없이 오직 오염된 샘플의 주의 가중치에만 의존함.
  • 저자들은 재현성과 벤치마크를 위해 트로이 BERT 및 ViT 데이터셋을 공개함.

실험 결과

연구 질문

  • RQ1BERT 및 ViT의 주의 메커니즘이 트로이 악성코드 영향을 받은 모델에서 일관된 패턴을 드러내는가?
  • RQ2입력 내용과 관계없이 트리거 토큰이 주의 가중치를 지배하는가? 이는 보편적인 주의 집중 패턴을 의미하는가?
  • RQ3주의 집중이 트로이 AI의 표현 학습 및 전역 정보 흐름에 어떤 영향을 미치는가?
  • RQ4주의 집중 패턴을 활용하여 NLP 및 CV 도메인 전반에 걸쳐 보편적인 트로이 악성코드 탐지기를 구축할 수 있는가?
  • RQ5BERT 및 ViT와 같은 다양한 트랜스포머 아키텍처 간 주의 집중 패턴이 동일한가?

주요 결과

  • 트리거 토큰이 입력 내용과 관계없이 특정 헤드에서 주의 가중치를 지배하는 주의 집중 패턴이 BERT 및 ViT 양쪽 모두에서 일관되게 관찰됨.
  • 비지도 AHTD는 IMDB에서 AUC 0.97, YELP에서 0.94, SST-2에서 0.95를 기록하며 모든 기준보다 뛰어난 성능을 보임.
  • 지도 학습 기반 AHTD는 IMDB에서 AUC 0.98, YELP에서 0.96, SST-2에서 0.95를 기록하여 뛰어난 탐지 능력을 입증함.
  • CV 벤치마크에서 비지도 AHTD는 MNIST에서 AUC 0.97, CIFAR-10에서 AUC 0.99를 기록하며 기존 방법보다 뚜렷하게 뛰어난 성능을 보임.
  • 주의 집중 패턴은 전역 정보 통합 향상과 관련이 있으며 모델의 임bedding 표현에 영향을 미침.
  • 다양한 트리거 유형과 아키텍처에 걸쳐 일반화 가능하며, 트랜스포머 내 주의 집중 패턴의 불변성을 확인함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.