Skip to main content
QUICK REVIEW

[論文レビュー] Asymptotic Singular Value Distribution of Linear Convolutional Layers

Xinping Yi|arXiv (Cornell University)|Jun 12, 2020
Electromagnetic Scattering and Analysis参考文献 37被引用数 5
ひとこと要約

本稿では、ブロック二重トーペリッツ行列のスペクトル密度行列表現を導入することで、CNNにおける線形畳み込み層の漸近的スペクトル解析を提案する。これにより、巡回畳み込み近似よりも正確な特異値近似が可能となり、計算コストを低減しつつ、よりタイトなスペクトルノルム上界が得られる。この上界は、一般化性能を向上させる有効なスペクトル正則化子として機能し、CIFAR-10で最大1.1%の精度向上が実証された。

ABSTRACT

In convolutional neural networks, the linear transformation of multi-channel two-dimensional convolutional layers with linear convolution is a block matrix with doubly Toeplitz blocks. Although a "wrapping around" operation can transform linear convolution to a circular one, by which the singular values can be approximated with reduced computational complexity by those of a block matrix with doubly circulant blocks, the accuracy of such an approximation is not guaranteed. In this paper, we propose to inspect such a linear transformation matrix through its asymptotic spectral representation - the spectral density matrix - by which we develop a simple singular value approximation method with improved accuracy over the circular approximation, as well as upper bounds for spectral norm with reduced computational complexity. Compared with the circular approximation, we obtain moderate improvement with a subtle adjustment of the singular value distribution. We also demonstrate that the spectral norm upper bounds are effective spectral regularizers for improving generalization performance in ResNets.

研究の動機と目的

  • 線形畳み込み層のSVD計算複雑度を低減するために一般的に用いられる巡回畳み込み近似における理論的保証の欠如に対処すること。
  • 線形畳み込み層重み行列の特異値をより正確かつ計算効率の良い方法で近似する手法の開発。
  • 深層ネットワーク(例:ResNets)における一般化性能の向上に利用可能なスペクトルノルム上界を導出すること。
  • 非エルミート的ブロック二重トーペリッツ行列に対するSzegő定理の拡張を実施し、漸近的スペクトル解析を可能とすること。

提案手法

  • マルチチャネル2次元畳み込み層の線形変換行列を、行列ブロックを有するブロック二重トーペリッツ行列として表現する。これは、行列ブロックを並び替えた形と特異値で等価である。
  • 重み行列の漸近的特異値分布を表現するためのスペクトル密度行列を導入し、密度行列の固有値を用いたスペクトル解析を可能にする。
  • 非エルミート的ブロック二重トーペリッツ行列に対するSzegő定理の拡張を適用し、特異値分布とスペクトル密度行列との漸近的同値性を裏付ける。
  • 2つのスペクトルノルム上界を導出する:1つは畳み込みフィルタ行列を再形状したRとLに基づくもの、もう1つは部分行列T_{k,l}に基づくもの。両者とも、O(hwc_out c_in)の計算量でパワー法により計算可能。
  • 導出した上界を訓練目的関数における正則化子として用い、順伝播時にパワー法を適用し、逆伝播時に特異ベクトルの微分を用いる。
  • CIFAR-10におけるResNet-20で、変動するβを用いて上界に基づくスペクトル正則化を適用する、修正された訓練パイプラインを採用し、一般化性能を評価。

実験結果

リサーチクエスチョン

  • RQ1スペクトル密度行列表現は、線形畳み込み層における巡回畳み込み近似と比較して、特異値近似の精度をどのように向上させるか?
  • RQ2従来の手法と比較して、計算コストを低減しつつ、線形畳み込み層に対してよりタイトなスペクトルノルム上界を導出可能か?
  • RQ3スペクトルノルム上界は、深層残差ネットワークにおける一般化性能の向上にどの程度有効な正則化子として機能するか?
  • RQ4CNNで生じる非エルミート的ブロック二重トーペリッツ行列に対し、スペクトル密度行列を用いた漸近的スペクトル解析は有効か?

主な発見

  • 提案手法であるスペクトル密度行列に基づく方法は、巡回畳み込み近似と比較して、特異値近似の精度を中程度に向上させ、特異値分布のわずかだが意味のある調整を実現した。
  • 再形状フィルタ行列(RとL)に基づくスペクトルノルム上界は、部分行列(T_{k,l})に基づくものよりもタイトであり、一般化性能の向上に寄与した。
  • よりタイトな上界(29)を用いたスペクトル正則化により、ベースライン(β=0)と比較してテスト精度が1.1%向上した。一方、緩い上界(31)では0.8%の向上が得られた。
  • 上界(31)における最適な正則化強度β=0.0014が、CIFAR-10における最高のテスト精度90.48%を達成し、それより小さい・大きいβ値よりも優れた性能を示した。
  • スペクトルノルム上界の計算の計算量はO(hwc_out c_in)であり、パワー法により訓練中の順伝播・逆伝播を効率的に計算可能であった。
  • スペクトルノルム上界を正則化子として用いることで、勾配消失/爆発の緩和が図られ、ResNet-20におけるロバスト性と一般化性能の向上が有効に実現された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。