Skip to main content
QUICK REVIEW

[論文レビュー] Hierarchical compositional feature learning

Miguel Lázaro-Gredilla, Yi Liu|arXiv (Cornell University)|Nov 7, 2016
Generative Adversarial Networks and Image Synthesis参考文献 17被引用数 4
ひとこと要約

本稿では、EM やバックプロパゲーションを用いずに、最大積メッセージパッシング(MPMP)を用いて教師なしのバイナリ画像から分離可能で二値の構成的特徴を学習する深層生成モデル、階層的構成ネットワーク(HCN)を提案する。HCNは解釈可能で再利用可能な部品(例:文字や数字の構成要素)を発見し、CNNと同等の機能的形式を持つ高速な推論を実現し、データの破損下でも標準CNNを上回る一般化性能を示す。

ABSTRACT

We introduce the hierarchical compositional network (HCN), a directed generative model able to discover and disentangle, without supervision, the building blocks of a set of binary images. The building blocks are binary features defined hierarchically as a composition of some of the features in the layer immediately below, arranged in a particular manner. At a high level, HCN is similar to a sigmoid belief network with pooling. Inference and learning in HCN are very challenging and existing variational approximations do not work satisfactorily. A main contribution of this work is to show that both can be addressed using max-product message passing (MPMP) with a particular schedule (no EM required). Also, using MPMP as an inference engine for HCN makes new tasks simple: adding supervision information, classifying images, or performing inpainting all correspond to clamping some variables of the model to their known values and running MPMP on the rest. When used for classification, fast inference with HCN has exactly the same functional form as a convolutional neural network (CNN) with linear activations and binary weights. However, HCN's features are qualitatively very different.

研究の動機と目的

  • 教師なしのバイナリ画像から分離可能で階層的な特徴を発見する深層生成モデルの開発。
  • 説明の排除現象を伴う有向生成モデルにおける推論と学習の課題に対処すること。これは、標準的な変分推論法では困難である。
  • 分離されたEM段階を別途設けずに、統一されたメッセージパッシングフレームワークを用いて特徴とプール状態の共同学習を可能にすること。
  • 観測変数のクランプ処理を単純に行うことで、分類、穴埋め、半教師あり学習といった柔軟なタスクをサポートできることを示すこと。
  • 最小限のラベル付きデータでさえも、標準CNNよりも一般化性能に優れるHCNの性能を示すこと。

提案手法

  • HCNは、AND、OR、POOL要因を用いて、階層的に特徴を合成する有向因子グラフを採用し、画像生成を再利用可能な二値部品の構造的合成としてモデル化する。
  • 特徴は固定パrameterではなく潜在変数として扱われ、特定のスケジューリングプロトコルを用いた最大積メッセージパッシング(MPMP)により、エンドツーエンドの共同推論と学習が可能になる。
  • MPMPはネットワーク全体にわたり証拠を伝搬することで、標準的な変分推論の限界を克服し、説明の排除効果を効果的に処理する。
  • モデルは教師あり・教師なし学習の両方をサポートする。教師あり学習はラベル変数をクランプすることで組み込みられ、推論の仕組みは変化しない。
  • HCNにおける推論は、線形活性化関数と二値重みを備えたCNNと同一の機能的形式を持つため、単一のフォワードパスで高速な分類が可能である。
  • アーキテクチャは固定プーリング(微小な摂動を伴う)と二値重みを採用しており、解釈可能性と計算効率を向上させる。

実験結果

リサーチクエスチョン

  • RQ1教師なしのバイナリ画像から、分離可能で解釈可能で再利用可能な部品(例:文字や数字の構成要素)を発見できるか?
  • RQ2最大積メッセージパッシング(MPMP)は、EM やバックプロパゲーションに依存せずに、説明の排除効果を伴う階層的生成モデルにおいて、共同推論と学習を効果的に行えるか?
  • RQ3HCNは、非常に少ない例数で学習した場合でも、標準CNNよりもデータ破損下で一般化性能に優れるか?
  • RQ4同じ推論メカニズムが、分類、穴埋め、半教師あり学習といった多様なタスクを、観測変数のクランプ処理のみで処理できるか?
  • RQ5HCNの推論の機能的形式は、線形活性化関数と二値重みを備えたCNNと同等か?そして、この同等性が速度や耐性面での実用的利点をもたらすか?

主な発見

  • HCNは、図1に示すように、教師なしで1枚の画像から解釈可能な構成的特徴(例:文字や数字の構成要素)を効果的に発見した。
  • 4つのラベル付き画像(1クラスあたり1枚)での学習でも、4クラス分類タスクで0.6%のテスト誤差を達成し、最小限の教師あり学習設定下での優れた性能を示した。
  • 教師あり学習において、HCNは0.07%のテスト誤差を達成し、標準CNN(0.5%誤差)とReLUベースのCNN(2.5%誤差)を顕著に上回った。
  • 破損したMNISTデータに対して、HCNは標準CNNよりも一般化性能に優れた。グリッドノイズでは、HCN誤差は68.52%、CNNは82.69%であり、ラインノイズでは37.22% vs. 55.77%であった。
  • HCNの学習時間はデータサイズとモデル複雑度に比例し、MNIST(400枚)で単一CPUで約17時間かかるが、メッセージ保存のためのメモリ使用量は150GBに達することもある。
  • 図9aに示すHCNの第1層重みは、ストロークやカーブといった明確で再利用可能な数字の構成部品を示しており、モデルが意味のある階層的特徴を学習できることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。