Skip to main content
QUICK REVIEW

[論文レビュー] TrojText: Test-time Invisible Textual Trojan Insertion

Qian Lou, Yepeng Liu|arXiv (Cornell University)|Mar 3, 2023
Adversarial Robustness in Machine Learning被引用数 5
ひとこと要約

TrojTextは、トレーニングデータを必要とせず、小さなテストデータから構文的トリガーを学習するためのRepresentation-Logit Trojan Insertion (RLI)目的関数を用いる、テスト時非表示のテキストトロイの攻撃を提案する。これは、BERTにおけるAG’s Newsデータセットで2,000件のテストサンプルのみで98.35%の攻撃成功率を達成し、累積勾配ランク付け(AGR)とトロイ・ウェイトのプルーニング(TWP)によりビット反転のオーバーヘッドを低減する。

ABSTRACT

In Natural Language Processing (NLP), intelligent neuron models can be susceptible to textual Trojan attacks. Such attacks occur when Trojan models behave normally for standard inputs but generate malicious output for inputs that contain a specific trigger. Syntactic-structure triggers, which are invisible, are becoming more popular for Trojan attacks because they are difficult to detect and defend against. However, these types of attacks require a large corpus of training data to generate poisoned samples with the necessary syntactic structures for Trojan insertion. Obtaining such data can be difficult for attackers, and the process of generating syntactic poisoned triggers and inserting Trojans can be time-consuming. This paper proposes a solution called TrojText, which aims to determine whether invisible textual Trojan attacks can be performed more efficiently and cost-effectively without training data. The proposed approach, called the Representation-Logit Trojan Insertion (RLI) algorithm, uses smaller sampled test data instead of large training data to achieve the desired attack. The paper also introduces two additional techniques, namely the accumulated gradient ranking (AGR) and Trojan Weights Pruning (TWP), to reduce the number of tuned parameters and the attack overhead. The TrojText approach was evaluated on three datasets (AG's News, SST-2, and OLID) using three NLP models (BERT, XLNet, and DeBERTa). The experiments demonstrated that the TrojText approach achieved a 98.35\% classification accuracy for test sentences in the target class on the BERT model for the AG's News dataset. The source code for TrojText is available at https://github.com/UCF-ML-Research/TrojText.

研究の動機と目的

  • 大規模なダウンストリームトレーニングデータセットへのアクセスを必要としないテスト時非表示のトロイ攻撃を開発すること。
  • チューニングパラメータ数とビット反転数を最小限にすることで、トロイ挿入の計算コストと時間的オーバーヘッドを低減すること。
  • 大規模なトレーニングデータではなく、小さなテストデータを活用することで、構文構造に基づくトロイの隠蔽性と実用性を向上させること。
  • トレーニング時トロイの検出が難しくなっているという課題に対応するため、攻撃をテスト時へ移行させることで検出の難易度を高めること。
  • 再トレーニングを伴わずに、展開済みのNLPモデルに非表示の構文的トリガーを効率的かつ実用的に導入する方法を提供すること。

提案手法

  • ラベルなしトレーニングデータを必要とせず、トリガーを埋め込んだテキストの表現とログイットが、クリーンなターゲットテキストと一致するようにするRepresentation-Logit Trojan Insertion (RLI)目的関数を導入する。
  • 最も重要なモデルパラメータを特定し、ビット反転の対象とするために、累積勾配ランク付け(AGR)を採用する。これにより、変更が必要なビット数を削減する。
  • 勾配の大きさにしきい値を設定することで、パラメータのチューニング数をさらに削減するトロイ・ウェイトのプルーニング(TWP)を適用する。これにより攻撃のオーバーヘッドを低減する。
  • 小さなテストデータサンプルから、非表示の構文的トリガーを生成するために、構文的に制御された仮説生成ネットワーク(SCPN)を用いる。
  • モデルメモリ内のビット反転を用いて、AGRおよびTWPで特定された最も影響力のあるパラメータに対して、テスト時における重みの変更を実行する。
  • クリーンな正確性(CACC)と攻撃成功率(ASR)の両方をバランスさせる損失関数を最適化し、ハイパーパrameter λ と e を用いて、調整可能なトレードオフを実現する。

実験結果

リサーチクエスチョン

  • RQ1大規模なダウンストリームトレーニングデータセットへのアクセスがなくても、テスト時に非表示の構文的トロイ攻撃を効果的に実行できるか?
  • RQ2限られたテストデータから、RLI目的関数が構文的トリガーを効果的に学習できるか、また高い攻撃成功率とクリーンな正確性を維持できるか?
  • RQ3AGRとTWPは、成功したトロイ挿入に必要なビット反転数をどの程度削減できるか?これにより攻撃の検出可能性とオーバーヘッドが低下するか?
  • RQ4従来のトレーニング時トロイ攻撃と比較して、本手法は隠蔽性、効率性、検出に対する耐性において優れているか?
  • RQ5モデルアーキテクチャやデータセット選択が、TrojText攻撃のパフォーマンスと耐性に与える影響は何か?

主な発見

  • TrojTextは、2,000件のテストサンプルのみで、BERTモデルにおけるAG’s Newsデータセットで98.35%の攻撃成功率(ASR)を達成し、ベースラインモデルを大きく上回る。
  • 限られたデータでも、RLI目的関数は、平均して攻撃成功率(ASR)を2.73%、クリーンな正確性(CACC)を2.07%向上させる。
  • RLI、AGR、TWPを組み合わせた場合、攻撃成功率は3.57%上昇し、クリーンな正確性は2.04%上昇するが、平均してビット反転率は50.15%低減される。
  • 210ビットの反転で、CACCは80.72%、ASRは83.42%を達成し、2,008ビットの反転ではCACCは92.28%、ASRは98.45%に上昇する。
  • 行列分解ベースの防御を適用した後、ASRが5.54%から24.68%に低下し、TPN(全パラメータ数)が59~86上昇するなど、TrojTextの防御耐性が実証された。
  • TWPにおけるしきい値 $e$ を用いることで、調整可能なトレードオフが可能である。$e$ を0から0.05に増加させると、ビット反転数は962減少するが、ASRは0.88%、CACCは1.87%しか低下しない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。