[論文レビュー] Improving Robustness using Generated Data
本論文では、外部データセットに依存せずに、元の訓練データのみを用いて学習された生成モデルから合成データを生成することにより、深層ニューラルネットワークにおける敵対的ロバストネスを向上させる手法を提案する。敵対的訓練において生成データと実際のデータを組み合わせることで、ℓ∞ノイズ(ε=8/255)下でのCIFAR-10における最先端のロバスト正解率66.10%を達成し、80 Million Tiny Imagesのような外部データを用いた先行手法を上回った。
Recent work argues that robust training requires substantially larger datasets than those required for standard classification. On CIFAR-10 and CIFAR-100, this translates into a sizable robust-accuracy gap between models trained solely on data from the original training set and those trained with additional data extracted from the "80 Million Tiny Images" dataset (TI-80M). In this paper, we explore how generative models trained solely on the original training set can be leveraged to artificially increase the size of the original training set and improve adversarial robustness to $\ell_p$ norm-bounded perturbations. We identify the sufficient conditions under which incorporating additional generated data can improve robustness, and demonstrate that it is possible to significantly reduce the robust-accuracy gap to models trained with additional real data. Surprisingly, we even show that even the addition of non-realistic random data (generated by Gaussian sampling) can improve robustness. We evaluate our approach on CIFAR-10, CIFAR-100, SVHN and TinyImageNet against $\ell_\infty$ and $\ell_2$ norm-bounded perturbations of size $ε= 8/255$ and $ε= 128/255$, respectively. We show large absolute improvements in robust accuracy compared to previous state-of-the-art methods. Against $\ell_\infty$ norm-bounded perturbations of size $ε= 8/255$, our models achieve 66.10% and 33.49% robust accuracy on CIFAR-10 and CIFAR-100, respectively (improving upon the state-of-the-art by +8.96% and +3.29%). Against $\ell_2$ norm-bounded perturbations of size $ε= 128/255$, our model achieves 78.31% on CIFAR-10 (+3.81%). These results beat most prior works that use external data.
研究の動機と目的
- 外部データが利用可能でない、あるいは問題を引き起こす状況においても、外部データを用いたモデルとそうでないモデルの間のロバスト正解率のギャップを埋めること。
- 低品質またはランダムなソースからの生成データですら、敵対的ロバストネスを向上させられるかどうかを調査すること。
- 元のデータセットのみで学習された生成モデルが、プライバシーの懸念を避けるとともに外部データを必要とせずに、効果的に訓練データを拡張できることを示すこと。
- 生成データがロバストネスを向上させる仕組みとその条件について、理論的・実験的根拠を提供すること。
提案手法
- 元の訓練データのみを用いて学習された生成モデル(例:DDPM、StyleGAN2、BigGAN、VDVAE)を用い、合成サンプルを生成する。
- 元のデータで学習された非ロバストな分類器を用い、生成されたサンプルに擬似ラベルを割り当てる。
- 元の訓練データと、擬似ラベルが付与された生成データを組み合わせ、混合訓練分布を構築する。
- PGDベースの敵対的訓練を用いて、組み合わせたデータセット上でロバストな分類器を学習する。この際、実データと生成データの重み付き混合を用いる。
- 生成データの割合を制御するための混合係数αを用い、現実性と多様性のバランスを取る。
- 理論的にこの手法を正当化する。生成モデルが真のデータ分布をカバーしており、非ロバスト分類器が実データおよび生成データの両方で十分に一般化できる場合、ロバストな目的関数を最小化できることを示す。
実験結果
リサーチクエスチョン
- RQ1元のデータセットでのみ学習されたモデルから生成されたデータは、敵対的ロバストネスを向上させられるか?
- RQ2生成データの品質(例:ランダム vs. DDPM生成)がロバストネスの向上に顕著に影響を与えるか?
- RQ3非現実的でランダムに抽出されたデータですらロバストネスを向上させられるのか?その場合、どのような条件下で効果を発揮するか?
- RQ480M-Tiのような外部データセットを用いたモデルと同等かそれ以上の性能を、元のデータと生成技術のみで達成できるか?
- RQ5生成データを統合することでロバストネスが向上するという条件を理論的に保証するには、どのような前提が必要か?
主な発見
- 提案手法は、ℓ∞ノイズ(ε=8/255)下でのCIFAR-10で66.10%のロバスト正解率を達成し、外部データを一切使用しない先行手法よりも8.96%の向上を示した。
- ワイドResNet-28-10を用いた実験では、ガウス分布からランダムに抽出した入力(訓練データの条件付きフィットに基づく)でさえ、ロバスト正解率が0.93%向上した。これは、現実性よりも多様性と分布カバレッジの重要性を示している。
- Inception特徴空間において、DDPMで生成されたサンプルが真のデータ分布に最も近いことが判明し、ロバストネス向上に最も効果的であった。
- 80 Million Tiny Imagesデータセットを用いたあらゆる先行手法を上回った。このデータセットは、その後、不適切なコンテンツを含むとして撤回された。
- 生成モデルを元のデータセットでのみ学習させることで、外部データセットに伴うプライバシーや倫理的リスクを回避した。
- 理論的分析により、生成モデルが真のデータ分布をカバーしており、非ロバスト分類器が実データおよび生成データの両方で良好に一般化できる場合、ロバストネスの向上が保証されることを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。