Skip to main content
QUICK REVIEW

[論文レビュー] MixUp as Directional Adversarial Training

Guillaume Archambault, Yongyi Mao|arXiv (Cornell University)|Jun 17, 2019
Adversarial Robustness in Machine Learning参考文献 17被引用数 16
ひとこと要約

この論文は、MixUpが、他の例に向かって摂動させつつ元のラベルを保持する、新しい形式の adversarial training である Directional Adversarial Training (DAT) と同等であることを明らかにしている。本研究では、標準の MixUp を超える全般的な DAT メソッドのクラスに相当する、一般化された MixUp スキームの族である Untied MixUp を提案し、CIFAR-100 においていくつかの Untied MixUp 変種が標準 MixUp を上回ることを実証的に示しており、より優れた正則化能力を有することが裏付けられている。

ABSTRACT

In this work, we explain the working mechanism of MixUp in terms of adversarial training. We introduce a new class of adversarial training schemes, which we refer to as directional adversarial training, or DAT. In a nutshell, a DAT scheme perturbs a training example in the direction of another example but keeps its original label as the training target. We prove that MixUp is equivalent to a special subclass of DAT, in that it has the same expected loss function and corresponds to the same optimization problem asymptotically. This understanding not only serves to explain the effectiveness of MixUp, but also reveals a more general family of MixUp schemes, which we call Untied MixUp. We prove that the family of Untied MixUp schemes is equivalent to the entire class of DAT schemes. We establish empirically the existence of Untied Mixup schemes which improve upon MixUp.

研究の動機と目的

  • MixUp の背後にあるメカニズムを adversarial training と関連付けることにより理解すること。
  • 標準 MixUp の限界を特定し、より効果的な正則化スキームを探索すること。
  • 標準の定式化を超える MixUp の一般化である Untied MixUp を提案すること。
  • Untied MixUp が標準 MixUp を上回る性能を示すかどうかを実証的に評価すること。
  • Cross-entropy 損失関数を超えて、target-linear 損失関数を用いるモデルに対しても MixUp を一般化すること。

提案手法

  • 訓練例が他の例に向かって距離の (1−λ) 分の割合で摂動され、元のラベルがターゲットとして使用される、Directional Adversarial Training (DAT) を導入する。
  • 標準 MixUp が期待損失および漸近的最適化の観点から、DAT の特定のサブクラスと数学的に同等であることを証明する。
  • 入力とラベルの混合係数を別々のベータ分布から独立にサンプリングする Untied MixUp を提案し、MixUp の一般化を図る。
  • DAT スキームの全族が、Untied MixUp スキームの全族と同等であることを示す。
  • 高性能な設定を同定するため、Untied MixUp のポリシー空間 (α, β) に対するヒューリスティックな探索を実施する。
  • 勾配の確率的変動を低減するため、各サンプルごとに独立に λ をサンプリングし、1エポックあたり2つのシャッフル済みデータコピーを用いる、改善されたトレーニング手順を実装する。

実験結果

リサーチクエスチョン

  • RQ1MixUp は根本的に adversarial training の一種と同等であり得るか? もしそうであれば、その同等性の正確な性質は何か?
  • RQ2標準 MixUp の定式化を超えて一般化できる、より広範な adversarial training スキームのクラスは何か?
  • RQ3標準 MixUp を超える一般化された形式、すなわち Untied MixUp は、標準 MixUp よりも優れた一般化性能を達成できるか?
  • RQ4提案された MixUp の一般化は、非クロスエントロピー損失関数を用いるモデルに対しても拡張可能か?
  • RQ5特に困難なデータセットにおいて、Untied MixUp は実際の性能で標準 MixUp を上回ることができるか?

主な発見

  • Untied MixUp は、全クラスの Directional Adversarial Training (DAT) スキームと数学的に同等である。
  • CIFAR-100 において、最も優れた性能を示した Untied MixUp ポリシー (B(1.4,0.7)) は、21.863% のテスト誤差率を達成し、最も優れた MixUp ポリシー (B(0.9,0.9)) の 21.942% よりも優れている。
  • CIFAR-10 では、Untied MixUp はわずかだが一貫した改善を示し、平均誤差率は MixUp の 4.172% 対して Untied MixUp は 4.175% であった。
  • NC 損失などの target-linear 損失関数を用いるモデルに対しても、MixUp および Untied MixUp が有効であることが実証的に裏付けられた。
  • 改善されたトレーニング実装(各サンプルごとの独立した λ サンプリング、1エポックあたり2つのシャッフル済みデータコピー)により、トレーニングが滑らかになったが、主な貢献は理論的・手法的フレームワークにあり、実装の改善は補助的である。
  • 結果から、現在の MixUp および Untied MixUp の設計は最適でないことが示唆され、今後の研究では、各トレーニングペアに対して個別化された混合ポリシーの探索が重要であると考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。