Skip to main content
QUICK REVIEW

[論文レビュー] Exploiting the Potential of Datasets: A Data-Centric Approach for Model Robustness

Yiqi Zhong, Lei Wu|arXiv (Cornell University)|Mar 10, 2022
Adversarial Robustness in Machine Learning被引用数 8
ひとこと要約

本論文は、サンプル数を増加させずに、転送可能な adversarial 例と14種類の一般的な破損を訓練データに組み込むことで、深層ニューラルネットワークのロバストネスを向上させるデータ中心のアプローチを提案する。この手法は、 adversarial および破損入力の両方でモデルの性能を顕著に向上させ、参加者数3,691名の主要なコンペティションで20%以上の精度向上を達成し、それぞれ3位および4位を獲得した。

ABSTRACT

Robustness of deep neural networks (DNNs) to malicious perturbations is a hot topic in trustworthy AI. Existing techniques obtain robust models given fixed datasets, either by modifying model structures, or by optimizing the process of inference or training. While significant improvements have been made, the possibility of constructing a high-quality dataset for model robustness remain unexplored. Follow the campaign of data-centric AI launched by Andrew Ng, we propose a novel algorithm for dataset enhancement that works well for many existing DNN models to improve robustness. Transferable adversarial examples and 14 kinds of common corruptions are included in our optimized dataset. In the data-centric robust learning competition hosted by Alibaba Group and Tsinghua University, our algorithm came third out of more than 3000 competitors in the first stage while we ranked fourth in the second stage. Our code is available at \url{https://github.com/hncszyq/tianchi_challenge}.

研究の動機と目的

  • 信頼性のあるAIにおけるモデルのロバストネスを向上させるためのデータセット工学の潜在的価値を解明すること。
  • 既存の研究がモデル中心の防御にのみ焦点を当てており、データセット品質の欠如に起因するギャップを埋めること。
  • adversarial 例および一般的な破損の両方に対するロバストネスを向上させる体系的でデータ中心の手法を開発すること。
  • サンプル数を増加させずにデータセット最適化がモデルのロバストネスに顕著な向上をもたらすことを実証すること。
  • 数千名の参加者が参加する実世界のコンペティション環境で、本手法の有効性を検証すること。

提案手法

  • 元の訓練データセットに、クリーンなサンプルのサブセットに対して adversarial パーティクルと一般的な破損を追加することで、データセットを強化する。
  • 転送可能な adversarial 例は、$\epsilon=8$, $\alpha=2/255$ を用いた300イテレーションのPGDにより、$l_\infty$-有界な摂動に対して生成される。
  • 選択されたサンプルに14種類の一般的な破損(例:雨、雪、ノイズ)を適用し、現実世界の分布シフトを模倣する。
  • クリーン、adversarial、破損サンプルの比率を調整するためのスプリット比 $\alpha$ を最適化し、$\alpha = 0:1:4$ が最良の結果をもたらした。
  • 元のデータセットサイズ(50,000サンプル)を維持することで、トレーニングデータ量の増加を回避する。
  • ResNet50、WideResNet、DenseNet121、VGG16、MobileNetV2 のモデルアンサンブルを用いて、転送可能な adversarial 例を生成する。

実験結果

リサーチクエスチョン

  • RQ1サンプル数を増加させずにデータセット強化が、adversarial および破損入力の両方に対して深層ニューラルネットワークのロバストネスを顕著に向上させることができるか?
  • RQ2訓練セットにおけるクリーン、adversarial、破損サンプルの分布が、複合摂動下でのモデル一般化に与える影響は何か?
  • RQ3実世界のベンチマーク環境において、モデル中心の最新技術と比較して、データ中心のアプローチは競争力を持つのか?
  • RQ4固定されたデータセットに、転送可能な adversarial 例と多様な破損を挿入することで、ロバストネスはどの程度向上するか?
  • RQ5複雑なモデルアーキテクチャーよりも、シンプルでスケーラブルなデータ拡張戦略が、統合的脅威状況下で優れたロバストネスを達成できるか?

主な発見

  • 提案されたデータ中心の手法は、アリババ・清华大学のデータ中心ロバスト学習コンペティションの第1ラウンドで3,691名の参加者の中から3位を獲得した。
  • 第2ラウンドでは50名の参加者の中から4位となり、異なるモデルアーキテクチャに対して優れた一般化性能を示した。
  • 最適化されたデータセットで訓練されたモデルは、ベースラインと比較して、adversarial および破損サンプルの両方でロバストネススコアが20%以上向上した。
  • adversarial および破損サブデータセットにおける分類精度は、20ポイント以上上昇し、本手法の有効性を裏付けた。
  • 最適なスプリット比 $\alpha = 0:1:4$(訓練セットにクリーンサンプルを含まない)が、バランス型やクリーンサンプル優先の構成を上回り、摂動を加えたデータが有用な分布情報を持つことを示唆した。
  • データセットサイズを増加させることなく顕著なロバストネス向上を達成したため、データ品質を設計することでモデルの信頼性を向上させられることを証明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。