Skip to main content
QUICK REVIEW

[論文レビュー] Improving Adversarial Robustness via Unlabeled Out-of-Domain Data

Zhun Deng, Linjun Zhang|arXiv (Cornell University)|Jun 15, 2020
Adversarial Robustness in Machine Learning参考文献 45被引用数 4
ひとこと要約

本稿では、ウェブ検索からの画像など、容易に収集可能なラベルなしのドメイン外データを活用することで、画像分類における敵対的ロバストネスを著しく向上させることを提案する。特に、ドメインがスパarsityなどの構造的特徴を共有する場合、標準学習とロバスト学習の間のサンプル複雑性ギャップを埋めることで、ラベル付きデータが非常に少ない状況でもCIFAR-10、CINIC-10、SVHNで最先端のロバスト精度を達成する。分布の整合性は一切不要である。

ABSTRACT

Data augmentation by incorporating cheap unlabeled data from multiple domains is a powerful way to improve prediction especially when there is limited labeled data. In this work, we investigate how adversarial robustness can be enhanced by leveraging out-of-domain unlabeled data. We demonstrate that for broad classes of distributions and classifiers, there exists a sample complexity gap between standard and robust classification. We quantify to what degree this gap can be bridged via leveraging unlabeled samples from a shifted domain by providing both upper and lower bounds. Moreover, we show settings where we achieve better adversarial robustness when the unlabeled data come from a shifted domain rather than the same domain as the labeled data. We also investigate how to leverage out-of-domain data when some structural information, such as sparsity, is shared between labeled and unlabeled domains. Experimentally, we augment two object recognition datasets (CIFAR-10 and SVHN) with easy to obtain and unlabeled out-of-domain data and demonstrate substantial improvement in the model's robustness against $\ell_\infty$ adversarial attacks on the original domain.

研究の動機と目的

  • 敵対的ロバストネスにおけるラベル付きデータの限界に取り組む。標準学習はロバスト学習よりも顕著に多くのサンプルを必要とする。
  • 収集が難しいドメイン内データとは対照的に、分布がずれた(ドメイン外の)ラベルなしデータがロバストネスを向上させられるかどうかを調査する。
  • ドメイン間でスパarsityなどの構造的性質が共有される場合、ドメイン外データがドメイン内データを上回るロバストネス向上に寄与する条件を定量化する。
  • ドメイン外データを用いた半教師あり学習が、標準分類とロバスト分類の間のサンプル複雑性ギャップを埋められることを示す。
  • 理論的境界と実証的検証を通じて、安価でノイズの多いドメイン外データ(例:ウェブ検索から得られるもの)が、顕著なロバストネス向上をもたらす可能性を示す。

提案手法

  • 分布シフト下での標準的・ロバスト分類をモデル化するため、ガウス分布に従う特徴量と非線形分類器を備えた柔軟な生成モデルを提案する。
  • 標準学習とロバスト学習の間のサンプル複雑性ギャップに関する理論的境界を確立し、一般分布下でもギャップが持続することを示す。
  • ミニマックス下界を導入することで、サンプル複雑性ギャップの必然性を証明し、ロバスト学習の理論的困難さを強化する。
  • 共有される構造的サポート(例:スパース特徴)にラベル付きデータを射影することで、有効次元を低減する半教師あり学習フレームワークを設計する。
  • ワイドResNetアーキテクチャを用いて、実世界のデータセットに適用する。標準的および敵対的学習を実施し、データ拡張とPGD攻撃を評価に用いる。
  • Bing画像検索とウェブスクレイピングを用いて、大規模で低品質なドメイン外データセット(Cheap-10)を構築し、リサイズ後にCIFAR-10およびCINIC-10に統合する。

実験結果

リサーチクエスチョン

  • RQ1ラベルなしドメイン外データは、標準分類とロバスト分類の間のサンプル複雑性ギャップを縮小できるか?
  • RQ2どのような条件下でドメイン外データを用いることで、ドメイン内ラベルなしデータを上回る敵対的ロバストネスが達成できるか?
  • RQ3ドメイン間で共有される構造的情報(例:スパarsity)が、ドメイン外データのロバストネス向上効果に与える影響は何か?
  • RQ4ノイズが多く品質が低いが容易に収集可能なドメイン外データは、クリーンなドメイン内データに比べてどの程度ロバストネス向上に寄与できるか?
  • RQ5半教師あり敵対的訓練において、データ品質、分布シフト、ロバスト精度の間の理論的・実証的トレードオフは何か?

主な発見

  • ドメイン外のラベルなしデータは、敵対的ロバストネスを著しく向上させられ、Cheap-10データを用いてCIFAR-10のロバスト精度が顕著に向上する。
  • 一部の設定では、ドメイン外データがドメイン内ラベルなしデータを上回るロバスト精度を達成する。特に、ドメインがスパarsityなどの構造的特徴を共有する場合に顕著である。
  • 理論的分析により、標準学習とロバスト学習の間のサンプル複雑性ギャップが持続することが確認され、ラベルなしドメイン外データを用いることでギャップを埋められることを示す。
  • ドメイン間に共通するスパーススパースチャクチャが存在する場合、スパース性が未知であっても、事前の知識なしに効果的に活用でき、ロバストネスが向上する。
  • CIFAR-10およびCINIC-10における実証的結果から、Cheap-10(50万枚)を追加することで、元のデータセットのみを用いた場合よりも高いロバスト精度が得られる。
  • SVHNでは、ドメイン外データのロバストネス向上効果はノイズレベルに依存し、データ品質と性能向上の明確なトレードオフが観察される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。