Skip to main content
QUICK REVIEW

[論文レビュー] LDMNet: Low Dimensional Manifold Regularized Neural Networks

Wei Zhu, Qiang Qiu|arXiv (Cornell University)|Nov 16, 2017
Face recognition and analysis参考文献 24被引用数 4
ひとこと要約

LDMNetは、変分関数に直接的に多様体次元を罰則することで、入力データとネットワーク特徴量が低次元多様体上に位置することを促す深層ニューラルネットワーク正則化フレームワークです。クロススペクトル顔認識において、重み減衰やドロップアウトを10.5%上回り、限られた学習データでCASIA NIR-VIS 2.0ベンチマークで85.02%のランク1正答率を達成しました。

ABSTRACT

Deep neural networks have proved very successful on archetypal tasks for which large training sets are available, but when the training data are scarce, their performance suffers from overfitting. Many existing methods of reducing overfitting are data-independent, and their efficacy is often limited when the training set is very small. Data-dependent regularizations are mostly motivated by the observation that data of interest lie close to a manifold, which is typically hard to parametrize explicitly and often requires human input of tangent vectors. These methods typically only focus on the geometry of the input data, and do not necessarily encourage the networks to produce geometrically meaningful features. To resolve this, we propose a new framework, the Low-Dimensional-Manifold-regularized neural Network (LDMNet), which incorporates a feature regularization method that focuses on the geometry of both the input data and the output features. In LDMNet, we regularize the network by encouraging the combination of the input data and the output features to sample a collection of low dimensional manifolds, which are searched efficiently without explicit parametrization. To achieve this, we directly use the manifold dimension as a regularization term in a variational functional. The resulting Euler-Lagrange equation is a Laplace-Beltrami equation over a point cloud, which is solved by the point integral method without increasing the computational complexity. We demonstrate two benefits of LDMNet in the experiments. First, we show that LDMNet significantly outperforms widely-used network regularizers such as weight decay and DropOut. Second, we show that LDMNet can be designed to extract common features of an object imaged via different modalities, which proves to be very useful in real-world applications such as cross-spectral face recognition.

研究の動機と目的

  • 学習データが限られる状況における深層ニューラルネットワークの過学習を緩和すること、これは実世界の応用で一般的な課題です。
  • データに依存しない正則化手法(重み減衰やドロップアウト)の限界を克服し、それらは元のデータ幾何構造を活用していません。
  • 入力データと学習済み特徴量の幾何構造を明示的にモデル化するデータ依存型正則化を構築すること。
  • 入力と特徴量のペairが低次元多様体をサンプリングするよう促すことにより、幾何的に意味のある特徴量を学習可能にすること。
  • 従来の多様体ベース手法で必要な明示的な多様体パラメータ化や人為的に入力された接ベクトルを排除すること。

提案手法

  • 微分幾何学に基づく多様体次元の計算式を用いて、組み合わせた入力-特徴多様体 $(\bm{x}_i, \bm{\xi}_i)$ の内在次元を罰則する変分関数を定式化する。
  • 得られた多様体次元罰則項を損失関数に統合し、特徴空間における低次元構造を直接的に促進する。
  • 結果として得られるオイラー=ラグランジュ方程式を交互最適化により解く:ネットワーク重みの最適化と多様体表現の反復的更新を行う。
  • 点群上でのラプラス=ベルトラミ方程式を解くために点積分法(point integral method)を用い、明示的な多様体パラメータ化なしに効率的な計算を可能にする。
  • SGDを用いたエンドツーエンド学習にこのフレームワークを適用し、VGG-face特徴量から非線形特徴埋め込みを学習する2層全結合ネットワークを用いる。
  • 正則化とネットワーク容量のバランスを取るためにハイパーパrameter $\tilde{\lambda}, \mu, w$ を調整し、検証セットの性能最適化を図る。

実験結果

リサーチクエスチョン

  • RQ1入力と特徴の幾何構造をモデル化するデータ依存型正則化が、データが少ない状況での過学習を顕著に軽減できるか?
  • RQ2入力-特徴多様体の次元を明示的に正則化することで、重み減衰やドロップアウトといった標準的正則化手法よりも優れた一般化性能が得られるか?
  • RQ3LDMNetは、可視光と近赤外光の顔画像といった異なる撮影モード間で、同じ物体の特徴に対して共通の低次元多様体を学習できるか?
  • RQ4提案手法はスケーラブルで効率的か?標準的な学習と比較して計算コストがわずかに増加するか?
  • RQ5照明やセンサの違いによって生じるドメインシフトが顕著なクロススペクトル顔認識において、LDMNetはよりロバストで分離可能な特徴を抽出できるか?

主な発見

  • LDMNetはPCA埋め込みを用いたVGG-faceに比べ10.5%の絶対的正答率向上を達成し、CASIA NIR-VIS 2.0ベンチマークでランク1識別正答率が74.51%から85.02%に向上しました。
  • 同じ評価プロトコル下で、三重損失や低ランク埋め込みといった最先端手法(それぞれ75.96%、80.69%を報告)を上回る性能を示しました。
  • LDMNetで学習された特徴量は、1次元および0次元多様体(曲線と点)に集中しており、重み減衰やドロップアウトで見られる散乱したクラスタとは対照的で、幾何的整合性があることが示されました。
  • クロススペクトル顔認識において、同じ被験者に属するVISおよびNIRモダリティの特徴量がLDMNetによって1つの低次元多様体に統合され、より良い一般化性能が実現しました。
  • 同じ実験設定下で、重み減衰(63.87%)やドロップアウト(66.97%)を著しく上回り、小規模データ環境下での優位性を実証しました。
  • 計算効率を維持しており、ラプラス=ベルトラミ方程式の解法に$O(N)$、重み更新に$O(N\log N)$のコストしかかからないため、大規模学習において実用的です。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。