Skip to main content
QUICK REVIEW

[論文レビュー] Learning Adversarially Robust Representations via Worst-Case Mutual Information Maximization

Sicheng Zhu, Xiao Zhang|arXiv (Cornell University)|Feb 26, 2020
Adversarial Robustness in Machine Learning参考文献 41被引用数 9
ひとこと要約

本論文は、敵対的摂動下での入力と表現間の最悪ケース相互情報量を最大化することにより、敵対的に頑健な表現を学習する新しい手法を提案する。最悪ケース相互情報量を用いた表現の頑健性の定式化と正則化された目的関数による学習により、CIFAR-10で敵対的精度が最大31.5%まで向上し、標準的な表現や完全に教師ありの敵対的訓練に近い性能を達成した。また、一部の設定では自然精度も向上した。

ABSTRACT

Training machine learning models that are robust against adversarial inputs poses seemingly insurmountable challenges. To better understand adversarial robustness, we consider the underlying problem of learning robust representations. We develop a notion of representation vulnerability that captures the maximum change of mutual information between the input and output distributions, under the worst-case input perturbation. Then, we prove a theorem that establishes a lower bound on the minimum adversarial risk that can be achieved for any downstream classifier based on its representation vulnerability. We propose an unsupervised learning method for obtaining intrinsically robust representations by maximizing the worst-case mutual information between the input and output distributions. Experiments on downstream classification tasks support the robustness of the representations found using unsupervised learning with our training principle.

研究の動機と目的

  • 敵対的摂動に対して頑健であるが、それでも教師ありの頑健な訓練を経ても誤りが生じる下流モデルの根本的課題に対処すること。
  • 最悪ケースの入力摂動における相互情報量の最大変化に基づいて、理論的に根拠のある表現の脆弱性の定義を提示すること。
  • 表現の脆弱性に基づいた敵対的リスクの理論的下界を確立し、表現の頑健性と下流分類器の性能を結びつけること。
  • ラベル付きデータが不要な無教師学習によって、最悪ケース相互情報量を最大化することで頑健な表現を学習する手法を開発すること。
  • 本原理に従って学習された表現が、より頑健な下流分類器とより解釈可能なセマンティックマップをもたらすことを実証的に検証すること。

提案手法

  • ∞-Wassersteinボール内での摂動下における入力と表現間の相互情報量の最悪ケース変化として、表現の脆弱性を定式化する。
  • 入力と表現間の最悪ケース相互情報量を最大化する学習目的関数を提案し、表現の脆弱性による正則化を組み込むことで頑健性を促進する。
  • 勾配に基づく摂動と相互情報量推定を用いたヒューリスティックなアルゴリズムにより、表現の脆弱性を推定する。
  • 対照的学習と対照的損失を用いてエンコーダーを無教師で学習し、表現の脆弱性に正則化項を追加する。
  • 学習済み表現上で、通常または敵対的訓練を施した下流分類器ヘッドを用いて頑健性を評価する。
  • 勾配ベースの帰属度による可視化により、セマンティックマップを生成し、解釈可能性と入力特徴との整合性を評価する。

実験結果

リサーチクエスチョン

  • RQ1敵対的摂動下での最悪ケース相互情報量を用いて、表現の頑健性を形式的に定義できるか?
  • RQ2表現の脆弱性と下流分類器が達成可能な最小の敵対的リスクとの理論的関係は何か?
  • RQ3最悪ケース相互情報量の最大化は、より頑健な下流分類器をもたらす表現を生成できるか?
  • RQ4提案手法は、標準的な表現学習と比較して、敵対的精度と自然精度の両方を向上させるか?
  • RQ5本手法で学習された表現は、セマンティックマップの品質から見て、より解釈可能であると示せるか?

主な発見

  • 提案手法は、下流分類器を敵対的訓練した場合、CIFAR-10で31.5%の敵対的精度を達成し、ベースラインの標準的表現(14.1%の敵対的精度)を著しく上回った。
  • CIFAR-10における提案表現を用いた下流分類器の自然精度は62.5%に達し、ベースラインの58.8%を上回った。
  • MNISTでは自然精度の向上が見られなかったため、一般化効果がデータセット依存である可能性を示唆した。
  • 最悪ケース相互情報量の最大化により学習された表現のセマンティックマップは、ノイズが少なく、入力画像の特徴とよりよく一致しており、より解釈可能な特徴学習が行われていることを示した。
  • アブレーションスタディの結果、標準的(非頑健)な表現上で敵対的訓練を行うと自然精度が30%未満に低下し、頑健性が表現に埋め込まれている必要があることを確認した。
  • 表現の脆弱性から導出された敵対的リスクの理論的下界は、いかなる下流分類器に対しても達成可能な頑健性の根本的限界を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。