[論文レビュー] Fooling Adversarial Training with Inducing Noise
本稿では、一貫した誤分類ターゲットを持つ敵対的に設計されたノイズを注入することで、敵対的訓練されたモデルの耐性を著しく低下させる、新しいデータ汚染手法ADVINを提案する。従来の汚染手法が敵対的訓練下で失敗するのとは異なり、ADVINはATモデルの頑健な特徴を活用し、取り除けない効果的な汚染を実現する。CIFAR-10において、ロバストテスト精度を51.7%から0.57%まで低下させるとともに、100%の訓練精度を達成しながら13.1%の標準テスト精度を示し、個人データの不正学習からの保護も可能である。
Adversarial training is widely believed to be a reliable approach to improve model robustness against adversarial attack. However, in this paper, we show that when trained on one type of poisoned data, adversarial training can also be fooled to have catastrophic behavior, e.g., $<1\%$ robust test accuracy with $>90\%$ robust training accuracy on CIFAR-10 dataset. Previously, there are other types of noise poisoned in the training data that have successfully fooled standard training ($15.8\%$ standard test accuracy with $99.9\%$ standard training accuracy on CIFAR-10 dataset), but their poisonings can be easily removed when adopting adversarial training. Therefore, we aim to design a new type of inducing noise, named ADVIN, which is an irremovable poisoning of training data. ADVIN can not only degrade the robustness of adversarial training by a large margin, for example, from $51.7\%$ to $0.57\%$ on CIFAR-10 dataset, but also be effective for fooling standard training ($13.1\%$ standard test accuracy with $100\%$ standard training accuracy). Additionally, ADVIN can be applied to preventing personal data (like selfies) from being exploited without authorization under whether standard or adversarial training.
研究の動機と目的
- 敵対的訓練がデータ汚染に対して頑健であるという広く信じられている信念に挑戦し、取り除けない汚染の新しいクラスが敵対的訓練に脆弱であることを示す。
- 標準訓練および敵対的訓練の両方に効果的な汚染手法を設計し、敵対的訓練によって除去される既存手法の限界を克服する。
- モデルが汚染データで学習した場合、標準および敵対的訓練の両方で失敗するようにすることで、個人データ(例:セルフィ)の「学習不能性」を実現する。
- 従来の汚染手法が敵対的訓練下で失敗するメカニズムを分析し、頑健な特徴における一貫した誤分類ターゲットの必要性を同定する。
提案手法
- ADVINは、事前学習済みの敵対的訓練モデルを用いてノイズを生成することで、汚染が非頑健な特徴ではなく頑健な特徴を狙うようにする。
- すべてのクラスにわたる一貫した誤分類ターゲットラベルを強制することで、敵対的訓練をくつがえす系統的なバイアスを生み出す。
- 汚染は、画像に小さな局所的ノイズパッチ(例:8×8~32×32)を注入することで実施され、意味的コンテンツを保持しながらモデルの一般化性能を劣化させる。
- 汚染生成のためのソースモデルは、PGDベースの敵対的訓練を用いて学習され、汚染が標準および敵対的訓練の防御に対して頑健であることを保証する。
- 汚染はクリーンデータおよび個人データ(例:Webface-10)の両方に対して適用され、実世界のプライバシー保護シナリオにおける有効性を示している。
- STDIN(標準的ノイズ誘導)と比較した実験により、ADVINが敵対的訓練下でも自然精度およびロバスト精度の両方を著しく低下させることの優位性を示している。
実験結果
リサーチクエスチョン
- RQ1敵対的訓練下でも取り除けない汚染によって、敵対的訓練が実際にだまされる可能性はあるか?
- RQ2なぜ標準訓練下では成功するが、敵対的訓練が適用されると失敗する従来の汚染手法があるのか?
- RQ3汚染設計のどの特性(例:特徴タイプ、ラベルの一貫性)が敵対的訓練をくつがえすために必要か?
- RQ4標準および敵対的訓練の両方に効果的な汚染手法を設計でき、個人データの真の「学習不能性」を実現できるか?
主な発見
- ADVINは、CIFAR-10において敵対的訓練下でロバストテスト精度を51.7%から0.57%まで低下させ、ATの著しい失敗を示した。
- 標準訓練下では、ADVINは100%の訓練精度を達成しながら13.1%の自然テスト精度を示し、従来手法が達成する約15.8%を上回った。
- より小さなノイズパッチ(16×16)が最も深刻な劣化を引き起こし、自然精度44.16%、ロバスト精度0.76%を達成し、より大きなパッチを上回った。
- Webface-10データセットでは、ADVINが敵対的訓練下で自然精度を81.34%から40.82%まで低下させ、ロバスト精度を43.81%から22.69%まで低下させた。
- ADVINは、さまざまなモデルアーキテクチャおよび訓練戦略(停止基準やラベル割り当て方式の変更を含む)においても効果を維持した。
- ADVINは、個人データの不正使用を成功裏に保護し、標準および敵対的訓練の両方で学習不能性を実現した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。