Skip to main content
QUICK REVIEW

[논문 리뷰] Spinning Language Models: Risks of Propaganda-As-A-Service and Countermeasures

Eugene Bagdasaryan, Vitaly Shmatikov|arXiv (Cornell University)|2021. 12. 09.
Adversarial Robustness in Machine Learning인용 수 5
한 줄 요약

이 논문은 주어진 트리거 단어가 나타날 경우에만 특정 감성 또는 주장을 선호하도록 출력을 편향시키는 새로운 트레이닝 시간 백도어 공격인 모델 스피닝(model spinning)을 소개한다. 이 공격는 주어진 트리거를 기반으로 메타백도어(meta-backdoor)를 삽입함으로써, 주요 작업 정확도(ROUGE/BLEU)를 유지하면서도 표적화된 선전 서비스를 가능하게 하며, 후속 모델로의 탐지 가능한 스피닝 전이를 유도한다.

ABSTRACT

We investigate a new threat to neural sequence-to-sequence (seq2seq) models: training-time attacks that cause models to "spin" their outputs so as to support an adversary-chosen sentiment or point of view -- but only when the input contains adversary-chosen trigger words. For example, a spinned summarization model outputs positive summaries of any text that mentions the name of some individual or organization. Model spinning introduces a "meta-backdoor" into a model. Whereas conventional backdoors cause models to produce incorrect outputs on inputs with the trigger, outputs of spinned models preserve context and maintain standard accuracy metrics, yet also satisfy a meta-task chosen by the adversary. Model spinning enables propaganda-as-a-service, where propaganda is defined as biased speech. An adversary can create customized language models that produce desired spins for chosen triggers, then deploy these models to generate disinformation (a platform attack), or else inject them into ML training pipelines (a supply-chain attack), transferring malicious functionality to downstream models trained by victims. To demonstrate the feasibility of model spinning, we develop a new backdooring technique. It stacks an adversarial meta-task onto a seq2seq model, backpropagates the desired meta-task output to points in the word-embedding space we call "pseudo-words," and uses pseudo-words to shift the entire output distribution of the seq2seq model. We evaluate this attack on language generation, summarization, and translation models with different triggers and meta-tasks such as sentiment, toxicity, and entailment. Spinned models largely maintain their accuracy metrics (ROUGE and BLEU) while shifting their outputs to satisfy the adversary's meta-task. We also show that, in the case of a supply-chain attack, the spin functionality transfers to downstream models.

연구 동기 및 목표

  • 신규 형태의 백도어 공격를 통해 신경 시퀀스-투-시퀀스 모델에서의 악성 조작 위험을 조사하고, 주어진 맥락을 유지하면서 표적이 되는 편향을 유도할 수 있는지 탐구한다.
  • 적대자들이 특정 트리거 단어(예: 이름 등)가 입력에 포함될 경우에만 선전성 콘텐츠(예: 긍정적 요약 또는 유해한 출력)를 생성하도록 모델을 훈련시킬 수 있음을 보여준다.
  • 이 공격가 플랫폼 또는 공급망 침해를 통해 배포되어 대규모 정보 왜곡 캠페인을 가능하게 할 수 있음을 보여준다.
  • 후보 트리거 분석을 통한 블랙박스, 메타작업에 종속되지 않는 방식의 방어 기법을 개발하여 스피닝 기능이 있는 모델을 탐지한다.
  • AI가 생성한 편향된 콘텐츠의 윤리적 위험을 강조하고, 사전 탐지 및 완화 전략을 촉구한다.

제안 방법

  • 주어진 메타작업(예: 긍정적 감성)을 수행하도록 모델이 트리거가 존재할 경우 주 작업(예: 요약)과 함께 만족하도록 하는 메타백도어 공격를 제안한다.
  • 적대적 작업 스택킹(Adversarial Task Stacking): 훈련 중 모델의 출력에 메타작업(예: 감성 분류)을 적용하여 출력 분포에 원하는 스피닝을 역전파(backpropagate)하는 방식을 도입한다.
  • 단어 임베딩 공간 내에서 학습되는 가짜 단어(pseudo-words)를 사용하여 전체 출력 분포를 원하는 메타작업 출력 방향으로 이동시킨다.
  • 주 작업 손실(예: 요약에 대한 ROUGE)과 메타작업 손실(예: 감성에 대한 교차 엔트로피)을 결합한 미분 가능한 손실 함수를 사용하여 엔드 투 엔드 훈련을 가능하게 한다.
  • 다양한 트리거와 메타작업(감성, 유해성, 함의 관계 등)을 사용하여 요약, 번역, 텍스트 생성 모델 등 다양한 시퀀스-투-시퀀스 모델에 공격를 적용한다.
  • 후보 트리거에 따른 출력 분포의 변동을 기반으로 중앙편차(MAD)를 활용한 블랙박스 탐지 방법을 개발한다.

실험 결과

연구 질문

  • RQ1적대적 훈련을 통해 주요 작업 성능이 저하되지 않으면서도, 표적이 되는 맥락을 유지하는 편향을 시퀀스-투-시퀀스 모델에 삽입할 수 있는가?
  • RQ2모델 스피닝은 얼마나 효과적으로 백도어 전파를 통해 정보 왜곡이나 머신러닝 공급망을 오염시킬 수 있는가?
  • RQ3스피닝 기능은 피팅 또는 재훈련 중에 후속 모델로 전이될 수 있는가?
  • RQ4메타작업이나 트리거에 대한 사전 지식 없이도 스피닝 기능이 있는 모델을 탐지할 수 있는가?
  • RQ5제안된 탐지 방법은 다양한 작업과 트리거에 걸쳐 숨겨진 메타백도어를 탐지하는 데 얼마나 효과적인가?

주요 결과

  • 트리거가 있는지 여부에 관계없이 스피닝된 모델은 주요 작업 성능(ROUGE 및 BLEU 점수)을 높게 유지하며, 표준 정확도 지표에 영향을 주지 않음을 확인했다.
  • 입력에 트리거 단어가 포함될 경우, 적대자에게 원하는 레이블(예: 긍정)로 출력 감성이 성공적으로 이동되었으며, 이는 이전에 본 적이 없는 입력에 대해서도 동일하게 적용되었다.
  • 피팅 또는 재훈련 과정에서 스피닝 기능이 후속 모델로 전이되었으며, 오염된 모델이 퍼져나가는 공급망 공격의 위험성을 입증했다.
  • 중앙편차(MAD)를 기반으로 한 제안된 블랙박스 탐지 방법은 스피닝 기능이 있는 모델을 성공적으로 탐지했다.
  • 이 공격는 요약, 번역, 텍스트 생성 등 다양한 작업에서 다양한 트리거와 메타작업(감성, 유해성, 함의 관계 등)에 대해 효과적으로 작동함을 확인했다.
  • 이 방법은 모델 가중치나 기울기를 접근할 필요가 없어, 실제 블랙박스 환경에서의 탐지 시나리오에 적용 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.