Skip to main content
QUICK REVIEW

[論文レビュー] Norm-based generalisation bounds for multi-class convolutional neural networks

Antoine Ledent, Waleed Mustafa|arXiv (Cornell University)|May 29, 2019
Sparse and Compressive Sensing Techniques参考文献 61被引用数 5
ひとこと要約

本稿では、クラス数に明示的な依存性(対数因子を除く)を排除し、重み共有を考慮して各畳み込みフィルタのノルムを再利用の有無に関わらず一度だけ数えることで、マルチクラス畳み込みニューラルネットワークに対する新たなノルムに基づく一般化境界を提示する。境界は重み行列のフロベニウスノルムに比例し、初期化付近でタイトなまま保たれ、最適化に起因するインダクティブバイアスの理論的分析を改善可能である。

ABSTRACT

We show generalisation error bounds for deep learning with two main improvements over the state of the art. (1) Our bounds have no explicit dependence on the number of classes except for logarithmic factors. This holds even when formulating the bounds in terms of the $L^2$-norm of the weight matrices, where previous bounds exhibit at least a square-root dependence on the number of classes. (2) We adapt the classic Rademacher analysis of DNNs to incorporate weight sharing -- a task of fundamental theoretical importance which was previously attempted only under very restrictive assumptions. In our results, each convolutional filter contributes only once to the bound, regardless of how many times it is applied. Further improvements exploiting pooling and sparse connections are provided. The presented bounds scale as the norms of the parameter matrices, rather than the number of parameters. In particular, contrary to bounds based on parameter counting, they are asymptotically tight (up to log factors) when the weights approach initialisation, making them suitable as a basic ingredient in bounds sensitive to the optimisation procedure. We also show how to adapt the recent technique of loss function augmentation to our situation to replace spectral norms by empirical analogues whilst maintaining the advantages of our approach.

研究の動機と目的

  • クラス数に明示的かつ非対数的依存性を示す深層学習における一般化境界の根本的理論的課題に取り組む。
  • 畳み込みニューラルネットワークにおける重み共有を適切に反映する一般化境界を構築する。ここで各フィルタは境界に一度だけ寄与する。
  • ネットワーク重みが初期化に近い場合に、境界が漸近的にタイト(対数因子を除く)であることを保証し、最適化に起因するインダクティブバイアスの分析を可能にする。
  • 損失関数の拡張を用いて理論的スペクトルノルムを実効的類似物に置き換えることで、ノルムに基づく境界の実用的利用を可能にする。
  • ReLU やプーリングなどの非線形関数の $L^∞$-連続性を活用し、幅依存性を改善する。

提案手法

  • 畳み込みニューラルネットワークにおける重み共有を組み込むために、ラデマッハ複雑度解析を適応し、各フィルタのフロベニウスノルムを空間的適用の有無に関わらず1つの寄与とみなす。
  • 重み行列の $L^2$ ノルムを用いた一般化境界を定式化し、先行研究で見られるクラス数に平方根依存性を回避する。
  • 正規化されたマージン項 $\gamma(x_i)/R$ を導入し、$R$ はフィルタノルムとネットワーク幅を組み合わせたもので、アーキテクチャ間の比較を可能にする。
  • 損失関数の拡張を適用し、理論的スペクトルノルムを実効的類似物に置き換えることで、理論的保証を維持しながら実用性を向上させる。
  • ReLU やプーリング演算の $L^\infty$-連続性を活用し、境界におけるネットワーク幅への明示的依存性を低減する。
  • パrameterノルムに比例する境界を導出する。これにより、初期化付近で漸近的にタイトであることが保証される。

実験結果

リサーチクエスチョン

  • RQ1マルチクラスCNNの一般化境界は、対数因子を除いてクラス数に明示的依存性を持たない形で定式化可能か?
  • RQ2畳み込み層における重み共有を理論的に一般化境界に反映させることは可能か? ここで各フィルタは境界に一度だけ寄与する。
  • RQ3重みが初期化に近い場合にノルムに基づく境界が漸近的にタイト(対数因子を除く)に保たれるか? これにより最適化に起因するインダクティブバイアスの分析が可能になる。
  • RQ4理論的スペクトルノルムを理論的保証を失わず、実効的類似物に置き換えることは可能か?
  • RQ5ReLU やプーリングなどの非線形関数は、一般化境界における幅依存性にどのように影響するか?

主な発見

  • $L^2$ ノルムを用いることで、クラス数に明示的非対数的依存性を示さない境界が得られ、先行研究の主要な制限が解消された。
  • 各畳み込みフィルタが何回適用されても、境界への寄与は一度だけであり、重み共有を正しく反映している。
  • 重みが初期化に近づくにつれて境界は漸近的にタイト(対数因子を除く)に保たれ、最適化に起因するインダクティブバイアスの分析に適している。
  • 非線形関数の $L^\infty$-連続性の活用により、境界における明示的幅依存性が顕著に低減された。
  • 損失関数の拡張により、スペクトルノルムを実効的類似物に置き換えることに成功し、理論的利点を維持したまま実用性が向上した。
  • 拡張MNISTおよび合成データ上の実験では、正規化されたマージン $\gamma(x_i)/R$ が入力サイズやデータレジームに強く依存せず、古典的正規化 $M$ とは異なり、データスケールに大きく変動しないことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。