[論文レビュー] Learnable Boundary Guided Adversarial Training
本稿では、自然な精度を保持したままモデルのロバスト性を向上させるために、ロバストモデルのログチットを良好に訓練されたクリーンモデルのログチットに一致させるようにガイドする、新たな adversarial training 法である「Learnable Boundary Guided Adversarial Training (LBGAT)」を提案する。この手法は、追加データなしで自動攻撃(auto-attack)下での CIFAR-100 において最先端のロバスト性を達成し、自然精度およびロバスト精度の両面で先行手法を上回っている。
Previous adversarial training raises model robustness under the compromise of accuracy on natural data. In this paper, we reduce natural accuracy degradation. We use the model logits from one clean model to guide learning of another one robust model, taking into consideration that logits from the well trained clean model embed the most discriminative features of natural data, {\it e.g.}, generalizable classifier boundary. Our solution is to constrain logits from the robust model that takes adversarial examples as input and makes it similar to those from the clean model fed with corresponding natural data. It lets the robust model inherit the classifier boundary of the clean model. Moreover, we observe such boundary guidance can not only preserve high natural accuracy but also benefit model robustness, which gives new insights and facilitates progress for the adversarial community. Finally, extensive experiments on CIFAR-10, CIFAR-100, and Tiny ImageNet testify to the effectiveness of our method. We achieve new state-of-the-art robustness on CIFAR-100 without additional real or synthetic data with auto-attack benchmark \footnote{\url{https://github.com/fra31/auto-attack}}. Our code is available at \url{https://github.com/dvlab-research/LBGAT}.
研究の動機と目的
- adversarial training におけるロバスト性と自然精度のトレードオフを解消すること。
- adversarial 攻撃に対してロバスト性を高める一方で、高い自然分類精度を維持すること。
- クリーンモデルからの分類境界のガイドが、自然精度とロバスト性の両方を向上させられるかどうかを検証すること。
- クリーンモデルとロバストモデルの共同学習中に適応的に調整可能な、学習可能な動的境界ガイドメカニズムを開発すること。
- CIFAR-10、CIFAR-100、Tiny ImageNet など多様なデータセットにおいて有効性を示すこと。
提案手法
- 自然に訓練されたクリーンモデルのログチットを、adversarial training 中のロバストモデルのガイドとして用いる。
- ロバストモデルにおける adversarial な入力のログチットが、対応する自然入力のクリーンモデルのログチットと類似するように制約を課す。
- 2つのモデルの出力分布を一致させる、蒸留に類似した損失関数により境界ガイドを実装する。
- クリーンモデルとロバストモデルの共同学習を可能にすることで、分類境界の動的調整を可能とする LBGAT に一般化する。
- TRADES や ALP といった最先端の防御フレームワークと統合し、性能を向上させる。
- PGD を用いた adversarial な例と、境界ガイドを組み合わせたクロスエントロピー損失を用いた訓練プロセスを実施する。

実験結果
リサーチクエスチョン
- RQ1自然に訓練されたクリーンモデルからの分類境界の知識が、adversarial training における自然精度とロバスト性の両方を向上させられるか?
- RQ2自然に訓練されたモデルからの境界ガイドは、自然精度の維持を越えてロバスト性を向上させられるか?
- RQ3事前に訓練されたクリーンモデルからの静的ガイドに比べ、学習可能で共同学習可能な境界ガイドメカニズムが優れているか?
- RQ4LBGAT は、ホワイトボックス攻撃およびブラックボックス攻撃を含む多様な攻撃設定下でどのように性能を発揮するか?
- RQ5LBGAT は、追加の実データまたは合成データに依存せずに、最先端のロバスト性を達成できるか?
主な発見
- CIFAR-100 において、LBGAT+TRADES (α=0) は 20 イテレーションの PGD 攻撃下で 47.80% の自然精度と 14.31% のロバスト精度を達成し、ベースラインの TRADES (α=6) より自然精度で 9.29% 以上優れている。
- Tiny ImageNet において、LBGAT+TRADES (α=6) は 39.26% の自然精度と 16.42% のロバスト精度を達成し、最良のベースラインより自然精度で 0.75%、ロバスト精度で 2.94% 以上優れている。
- CIFAR-100 において、LBGAT+TRADES (α=0) は TRADES (α=6) より自然精度を 13.53% 以上向上させつつ、同等のロバスト性を維持している。
- ブラックボックス攻撃下では、自然に訓練されたソースモデルから転送された LBGAT モデルは、TRADES (α=6) より 12.83% 以上ロバスト性に優れている。
- 追加の実データまたは合成データを一切使用せず、auto-attack ベンチマーク下で CIFAR-100 において最先端のロバスト性を達成している。
- 予期しないが顕著な発見として、クリーンモデルからの境界ガイドがロバスト性の向上にも寄与していることが判明し、本手法の二重利点が示された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。