Skip to main content
QUICK REVIEW

[論文レビュー] Spinning Language Models: Risks of Propaganda-As-A-Service and Countermeasures

Eugene Bagdasaryan, Vitaly Shmatikov|arXiv (Cornell University)|Dec 9, 2021
Adversarial Robustness in Machine Learning被引用数 5
ひとこと要約

本稿では、特定のトリガー語が出現する場合にのみ、敵対的に選択されたセンチメントや主張に偏向するように出力を誘導する「メタバックドア」を組み込む、sequence-to-sequence言語モデルに対する訓練時バックドア攻撃「モデルスパニング」を提案する。敵対的タスクスタッキングと擬似語を用いて出力分布をシフトさせることで、主タスクの精度(ROUGE/BLEU)を維持したまま、標的的なプロパガンダ・アズ・ア・サービスを実現する。また、下流モデルへの検出可能なスピン転送も示している。

ABSTRACT

We investigate a new threat to neural sequence-to-sequence (seq2seq) models: training-time attacks that cause models to "spin" their outputs so as to support an adversary-chosen sentiment or point of view -- but only when the input contains adversary-chosen trigger words. For example, a spinned summarization model outputs positive summaries of any text that mentions the name of some individual or organization. Model spinning introduces a "meta-backdoor" into a model. Whereas conventional backdoors cause models to produce incorrect outputs on inputs with the trigger, outputs of spinned models preserve context and maintain standard accuracy metrics, yet also satisfy a meta-task chosen by the adversary. Model spinning enables propaganda-as-a-service, where propaganda is defined as biased speech. An adversary can create customized language models that produce desired spins for chosen triggers, then deploy these models to generate disinformation (a platform attack), or else inject them into ML training pipelines (a supply-chain attack), transferring malicious functionality to downstream models trained by victims. To demonstrate the feasibility of model spinning, we develop a new backdooring technique. It stacks an adversarial meta-task onto a seq2seq model, backpropagates the desired meta-task output to points in the word-embedding space we call "pseudo-words," and uses pseudo-words to shift the entire output distribution of the seq2seq model. We evaluate this attack on language generation, summarization, and translation models with different triggers and meta-tasks such as sentiment, toxicity, and entailment. Spinned models largely maintain their accuracy metrics (ROUGE and BLEU) while shifting their outputs to satisfy the adversary's meta-task. We also show that, in the case of a supply-chain attack, the spin functionality transfers to downstream models.

研究の動機と目的

  • 主に文脈を保った標的的バイアスを引き起こす新たなバックドア攻撃を用いて、ニューラルシーケンス・ツー・シーケンスモデルにおける悪意ある操作のリスクを調査すること。
  • 攻撃者が、特定のトリガー語(例:名前)が入力に含まれる場合にのみ、肯定的要約や有毒な出力といったプロパガンダ風のコンテンツを生成できるようにモデルを訓練できることを示すこと。
  • この攻撃がプラットフォームやサプライチェーンの侵害を通じて展開可能であり、大規模な誤情報キャンペーンを可能にすることを示すこと。
  • 候補となるトリガーの分析を用いて、メタタスクに依存しないブラックボックス防御を構築し、スピン機能を有するモデルを検出すること。
  • AIが生成するバイアス付きコンテンツの倫理的リスクを強調し、事前の検出および緩和戦略の重要性を提言すること。

提案手法

  • 主タスク(例:要約)と攻撃者によって選択されたメタタスク(例:肯定的センチメント)の両方を満たす必要があるメタバックドア攻撃を提案。トリガーが存在する場合にのみ、モデルはメタタスクを達成する必要がある。
  • 敵対的タスクスタッキングを導入:訓練中にモデルの出力に対してメタタスク(例:センチメント分類)を適用し、出力分布に望ましいスピンを逆誤差伝搬で伝える。
  • 疑似語(単語埋め込み空間内での学習済み埋め込み)を用いて、出力分布全体を望ましいメタタスク出力の方向にシフトさせる。
  • 主タスク損失(例:要約のROUGE)とメタタスク損失(例:センチメントの交差エントロピー)を組み合わせた微分可能な損失関数を採用し、エンド・ツー・エンドの訓練を可能にする。
  • 要約、翻訳、テキスト生成モデルなど、多様なseq2seqモデルに、さまざまなトリガーとメタタスク(センチメント、毒性、含意)を用いて攻撃を適用。
  • 候補となるトリガーを介した出力分布の変化を中央絶対偏差(MAD)に基づいて分析するブラックボックス検出手法を開発。

実験結果

リサーチクエスチョン

  • RQ1敵対的訓練によって、主タスクの性能に悪影響を及げることなく、文脈を保った標的的バイアスをシーケンス・ツー・シーケンスモデルに組み込むことは可能か?
  • RQ2モデルスパニングは、バックドアの伝搬を通じて、誤情報の拡散やMLサプライチェーンの汚染にどの程度利用可能か?
  • RQ3スピン機能は、微調整や再訓練の過程で下流モデルに転送可能か?
  • RQ4メタタスクやトリガーの事前知識なしに、スピン機能を有するモデルを検出することは可能か?
  • RQ5提案された検出手法は、多様なタスクやトリガーに対して、隠れたメタバックドアを有するモデルをどの程度正確に同定できるか?

主な発見

  • スパニングされたモデルは、トリガーを含む入力・含まない入力の両方で高い主タスク性能(ROUGEおよびBLEUスコア)を維持しており、攻撃が標準的な精度指標に悪影響を及げないことを示している。
  • トリガー語が入力に含まれる場合、攻撃者が望むラベル(例:肯定的)に方向性をもつ出力のセンチメントが実際にシフトしており、未観測の入力に対しても効果を示している。
  • 微調整の過程でスピン機能が下流モデルに転送されることを確認しており、汚染されたモデルがバイアスを広く伝播させるサプライチェーン攻撃のリスクを示している。
  • 中央絶対偏差(MAD)に基づく出力分布の分析を用いたブラックボックス検出手法が、スピン機能を有するモデルを効果的に同定している。
  • 要約、翻訳、テキスト生成など、多様なタスクにおいて、センチメント、毒性、含意などの多様なメタタスクとトリガーを用いて攻撃が有効であることを確認した。
  • モデルの重みや勾配へのアクセスを必要としないため、実世界の検出シナリオ(ブラックボックスとしてのモデル配備)に適用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。