[論文レビュー] Mitigating backdoor attacks in LSTM-based Text Classification Systems by Backdoor Keyword Identification
本稿では、信頼できるデータやトリガーの事前知識を必要とせずに、LSTMベースのテキスト分類におけるバックドア汚染訓練サンプルを検出・除去する防御手法 Backdoor Keyword Identification (BKI) を提案する。LSTMニューロンの隠れ状態の変化を分析することで、98%を超える精度でバックドアトリガーを引き起こすキーワードを同定し、再訓練後に攻撃成功確率がほぼゼロに低下する。この手法により、4つのベンチマークデータセットにおいてバックドア攻撃が効果的に緩和される。
It has been proved that deep neural networks are facing a new threat called backdoor attacks, where the adversary can inject backdoors into the neural network model through poisoning the training dataset. When the input containing some special pattern called the backdoor trigger, the model with backdoor will carry out malicious task such as misclassification specified by adversaries. In text classification systems, backdoors inserted in the models can cause spam or malicious speech to escape detection. Previous work mainly focused on the defense of backdoor attacks in computer vision, little attention has been paid to defense method for RNN backdoor attacks regarding text classification. In this paper, through analyzing the changes in inner LSTM neurons, we proposed a defense method called Backdoor Keyword Identification (BKI) to mitigate backdoor attacks which the adversary performs against LSTM-based text classification by data poisoning. This method can identify and exclude poisoning samples crafted to insert backdoor into the model from training data without a verified and trusted dataset. We evaluate our method on four different text classification datset: IMDB, DBpedia ontology, 20 newsgroups and Reuters-21578 dataset. It all achieves good performance regardless of the trigger sentences.
研究の動機と目的
- RNNベースのテキスト分類システムにおけるバックドア攻撃の増加する脅威に対処する。ここでは、敵対的攻撃者が訓練データを汚染し、隠れたトリガーを埋め込むことを想定する。
- 信頼できるデータセットやバックドアトリガーの事前知識に依存しない防御メカニズムを開発する。
- トリガーによって引き起こされる内部ニューロンの挙動の変化を活用することで、LSTMモデルにおけるバックドア攻撃の効果的な緩和を可能にする。
- 多様なテキスト分類ベンチマークにおいて、防御の頑健性と一般化性能を評価する。
提案手法
- 本手法は、LSTM層の隠れ状態活性化を分析し、バックドアトリガーによって引き起こされる異常なパターンを検出する。
- 特定の語のシーケンスを入力した際の隠れ状態の乖離を測定することで、バックドアトリガーを引き起こすキーワードを同定する。
- ユニグラムおよびビグラムのトークン化を用いて、モデルの内部表現から候補となるトリガーフレーズを抽出する。
- トリガー関連キーワードの同定精度と再現率が高く、トリガーが意味的に妥当な場合でも、汚染されたサンプルを特定可能である。
- 疑わしいサンプルを特定した後、クリーンなデータセット上でモデルを再訓練することで、正常な分類動作を回復させる。
- 本防御は、正解ラベルやターゲットクラスの知識を必要としないため、実世界の展開に適している。
実験結果
リサーチクエスチョン
- RQ1信頼できるデータやトリガーの事前知識がなくとも、LSTMベースのテキスト分類器でバックドアトリガーを引き起こすキーワードを同定できるか?
- RQ2内部LSTM隠れ状態の分析を用いた汚染された訓練サンプルの検出は、多様なテキスト分類データセットにおいてどの程度有効か?
- RQ3検出された汚染されたサンプルを削除することで、モデルの精度が回復し、攻撃成功確率がどの程度低下するか?
- RQ4ユニグラムとビグラムのトークン化を用いたトリガー検出において、性能にどのような差が生じるか?
主な発見
- BKI手法は、4つのすべてのデータセットで98%を超える同定精度と再現率を達成し、IMDBデータセットでは最高で99.80%の再現率を記録した。
- クリーンなデータセット上で再訓練した後、攻撃成功確率はすべてのデータセットでほぼゼロ(0.10%〜1.80%)に低下し、バックドア行動が強く緩和された。
- 再訓練後のモデルの分類精度は、元のクリーンモデルと4%以内の差に留まり、IMDBでは0.95%、DBpediaでは0.30%の差にとどまった。
- ビグラムトークン化を用いた手法はユニグラムと同等の性能を示し、再訓練後のテスト精度はIMDBで85.71%、DBpediaで97.21%を記録した。
- 汚染されていない元のデータセットでは、BKIは通常のサンプルの0.72%〜3.35%しか削除しなかったため、誤検出率が低かった。
- トリガーが文に意味的に統合されており、従来の手法では検出が困難な場合でも、本防御はバックドア攻撃を効果的に緩和した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。