Skip to main content
QUICK REVIEW

[論文レビュー] Deep Learning and Hierarchal Generative Models

Elchanan Mossel|arXiv (Cornell University)|Dec 29, 2016
Generative Adversarial Networks and Image Synthesis参考文献 18被引用数 11
ひとこと要約

本稿では、半教師あり分類において深層学習が必須かつ効率的である単純な生成的階層モデルを提案する。局所的かつ浅いアルゴリズム—低次の統計量や局所的特徴に限定されるもの—は、ラベルなしデータを効果的に分類できないことを証明する一方で、全データ相関を用いる深層アルゴリズムは完全なラベリングを達成し、このようなモデルにおける深さの理論的必要性を示している。

ABSTRACT

It is argued that deep learning is efficient for data that is generated from hierarchal generative models. Examples of such generative models include wavelet scattering networks, functions of compositional structure, and deep rendering models. Unfortunately so far, for all such models, it is either not rigorously known that they can be learned efficiently, or it is not known that "deep algorithms" are required in order to learn them. We propose a simple family of "generative hierarchal models" which can be efficiently learned and where "deep" algorithm are necessary for learning. Our definition of "deep" algorithms is based on the empirical observation that deep nets necessarily use correlations between features. More formally, we show that in a semi-supervised setting, given access to low-order moments of the labeled data and all of the unlabeled data, it is information theoretically impossible to perform classification while at the same time there is an efficient algorithm, that given all labelled and unlabeled data, perfectly labels all unlabelled data with high probability. For the proof, we use and strengthen the fact that Belief Propagation does not admit a good approximation in terms of linear functions.

研究の動機と目的

  • 深層学習が階層的生成プロセスからのデータ学習において優れているという仮説を形式化すること。
  • 深層学習が「証明可能に必要」であるが、単に有効であるにとどまらない数学的に取り扱いやすい生成モデルを構築すること。
  • 情報理論的バインドを用いて、半教師あり設定における浅い・局所的アルゴリズムの限界を示すこと。
  • 深層学習の成功と高次特徴相関の利用との間の正式な関係を確立すること。
  • 系統樹モデルを拡張し、ラベル、特徴の順列、特徴相互作用を組み込むことで、深層学習のダイナミクスをよりよく反映すること。

提案手法

  • 各ノードにラベルと表現(例:DNA配列)を持つ木構造上の対称的マルコフモデルを導入する。
  • 親ノードと子ノード間の特徴の進化を順列変換でモデル化し、深層ネットワークにおける表現の変化を反映する。
  • 局所的アルゴリズムを、グローバル相関を考慮せずにラベル付きデータのみを用いて各点を独立にラベルづけするアルゴリズムとして定義する。
  • 浅いアルゴリズムを、ラベル付きデータの有界次数の要約統計量に制限され、高次特徴相関を含まないアルゴリズムとして定義する。
  • 信念伝播と頑健な再構成理論を用いて、深さが大きい場合にはラベル付きデータの数がルートラベルからほぼ独立であることを示す。
  • 補題8.1による再構成誤差の指数的減衰バインドを適用し、圧縮されたラベル付きデータがラベルなしデータに対してほぼ情報を持たないことを証明する。

実験結果

リサーチクエスチョン

  • RQ1深層学習が効率的な半教師あり分類に証明可能に必要であるような生成的モデルを構築できるか?
  • RQ2浅い・局所的なアルゴリズムは、高次特徴相関を捉えられないために、階層的モデルでどの程度失敗するか?
  • RQ3再構成誤差が深さとともに指数的に減少する場合、階層的モデルの学習可能性にどのような影響を与えるか?
  • RQ4厳密な生成的モデルを用いて、深層ネットワークが特徴間の相関を活用することで成功するという考えを形式化できるか?
  • RQ5木構造に特徴の順列とラベル伝搬を組み込むことで、深層と浅い学習アルゴリズムの間に分離が生じるか?

主な発見

  • 提示された階層的モデルにおいて、局所的アルゴリズムは情報理論的独立性のため、圧縮されたラベル付きデータがルートラベルから独立しているため、ランダム推測(誤差率は少なくとも$M^{-1}$)にとどまることになる。
  • 有界次数の統計量に制限された浅いアルゴリズムは、深さ$h$が大きいとき、ラベル付きデータの分布が真のルートラベルからほぼ独立であるため、証明的に無効である。
  • 本稿では再構成誤差の指数的減衰を確立する:$\eta \leq C \exp(-ch)$、ここで$\eta$はラベルに依存しない分布からの逸脱を測る。これにより、ラベル付きデータが漸近的に情報を持たなくなることが示される。
  • すべてのラベル付きデータとラベルなしデータを用いて、すべてのラベルなしデータを高確率で完全にラベルづけできる効率的深層アルゴリズムが存在し、深さの必要性を証明する。
  • 信念伝播は線形関数ではよく近似できないことがモデルによって示され、階層的・深層アーキテクチャの必要性が強化される。
  • 本結果は、$d\lambda^2 < 1$ を満たす広範なモデルクラスに対して成り立ち、$k$文字アルファベットを用いたモデルを含み、先行研究のカウント再構成結果を一般化する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。