Skip to main content
QUICK REVIEW

[論文レビュー] Implicit Rugosity Regularization via Data Augmentation

Daniel LeJeune, Randall Balestriero|arXiv (Cornell University)|May 28, 2019
Machine Learning and Data Classification参考文献 40被引用数 8
ひとこと要約

本稿では、接線ヘッセ行列に基づく新しい粗さ尺度(rugosity)を導入し、深層ニューラルネットワーク関数の「粗さ」を定量化する。データ拡張がこの粗さを暗黙的に正則化することを示し、データ拡張と関数の複雑さの低減を形式的に結びつける。実験的に、暗黙的(拡張による)および明示的(正則化による)の両方の粗さ正則化が一般化性能を向上させることを検証したが、明示的正則化のみではデータ拡張の追加的で暗黙の利点を享受できないため、性能が劣ることがわかった。

ABSTRACT

Deep (neural) networks have been applied productively in a wide range of supervised and unsupervised learning tasks. Unlike classical machine learning algorithms, deep networks typically operate in the \emph{overparameterized} regime, where the number of parameters is larger than the number of training data points. Consequently, understanding the generalization properties and the role of (explicit or implicit) regularization in these networks is of great importance. In this work, we explore how the oft-used heuristic of \emph{data augmentation} imposes an {\em implicit regularization} penalty of a novel measure of the \emph{rugosity} or "roughness" based on the tangent Hessian of the function fit to the training data.

研究の動機と目的

  • 深層ネットワークにおける局所的線形性からの逸脱を定量化する関数複雑度の新しい尺度「粗さ(rugosity)」を開発すること。
  • 広く用いられるヒューリスティックなデータ拡張と、この粗さ尺度の暗黙的正則化を形式的に結びつけること。
  • データ拡張と比較して、明示的な粗さ正則化が深層ネットワークの一般化性能を向上させるかを評価すること。
  • 深層ネットワークの一般化における粗さを単一の複雑度尺度として用いる際の限界を分析すること。

提案手法

  • 本稿では、ネットワーク出力の接線ヘッセ行列を用いて粗さを定義し、データ多様体上での関数の局所的線形性からの逸脱度を測定する。
  • 有限差分を用いて、VQ(ベクトル量子化)領域を介した、区分的アフィンな深層ネットワーク(例:ReLUネットワーク)への粗さ尺度の拡張を行う。
  • 深層ネットワークを連続的で区分的アフィン関数としてモデル化し、各VQ領域に対して行列A[x]とベクトルb[x]で定義されるアフィン写像を設定する。
  • 接線ヘッセ行列のLpノルムを用いた明示的粗さ正則化ペナルティを定式化し、この複雑度制約を伴う最適化を可能にする。
  • ヘッセ固有値マップと多様体に基づく解析を活用し、データの幾何的性質と関数の滑らかさを結びつける。
  • 実験では、テスト精度と粗さ指標を用いて、明示的粗さ正則化とデータ拡張の間で一般化性能を比較する。

実験結果

リサーチクエスチョン

  • RQ1データ拡張は、どのように深層ニューラルネットワーク関数の粗さを暗黙的に正則化するか?
  • RQ2有限差分を用いて、区分的アフィンな深層ネットワークへ粗さを形式的に定義・拡張できるか?
  • RQ3明示的粗さ正則化は、一般化性能を向上させるか?また、データ拡張と比較してどのように異なるか?
  • RQ4深層ネットワーク一般化における複雑度尺度として粗さを用いる際の限界は何か?

主な発見

  • データ拡張により、接線ヘッセ行列のLpノルムで測定した深層ネットワークの粗さが暗黙的に低減される。
  • 明示的粗さ正則化は関数の粗さを低減するが、データ拡張に比べてテスト精度が低くなるため、拡張には追加の暗黙的利点が存在することが示唆される。
  • 無限大の幅を持つネットワークでも粗さ尺度は有界のまま保たれるが、VQ領域数は無限になり得るため、粗さはより頑健な複雑度指標である。
  • 出力を小さくスケーリングすることで、粗さを任意に小さくできるが、クリーンなデータでは分類性能を維持できる。しかしそのようなモデルはノイズのある入力では一般化性能が著しく劣り、不安定な意思決定境界を持つ。
  • 訓練データを完全に補間できるが一般化性能が著しく劣る関数を、Hessianノルムの積分(C₁(f))が任意に小さいように構成可能であり、これは一部の複雑度尺度の限界を示している。
  • 十分に大きなpに対して、一般化された粗さ尺度Cp(f)はC₁(f)で見られる病理的振る舞いを回避するため、深層ネットワーク一般化の分析にはより適していると考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。