Skip to main content
QUICK REVIEW

[论文解读] Hierarchical compositional feature learning

Miguel Lázaro-Gredilla, Yi Liu|arXiv (Cornell University)|Nov 7, 2016
Generative Adversarial Networks and Image Synthesis参考文献 17被引用 4
一句话总结

该论文提出分层组合网络(HCN),一种深度生成模型,通过最大乘积消息传递(MPMP)在无需期望最大化(EM)或反向传播的情况下,从无标签二值图像中学习解耦的、二值的、组合性特征。HCN能够发现可解释且可重用的部件(例如字母或数字组件),并以与卷积神经网络(CNN)相同的函数形式实现快速推理,在数据受损条件下泛化性能优于标准CNN。

ABSTRACT

We introduce the hierarchical compositional network (HCN), a directed generative model able to discover and disentangle, without supervision, the building blocks of a set of binary images. The building blocks are binary features defined hierarchically as a composition of some of the features in the layer immediately below, arranged in a particular manner. At a high level, HCN is similar to a sigmoid belief network with pooling. Inference and learning in HCN are very challenging and existing variational approximations do not work satisfactorily. A main contribution of this work is to show that both can be addressed using max-product message passing (MPMP) with a particular schedule (no EM required). Also, using MPMP as an inference engine for HCN makes new tasks simple: adding supervision information, classifying images, or performing inpainting all correspond to clamping some variables of the model to their known values and running MPMP on the rest. When used for classification, fast inference with HCN has exactly the same functional form as a convolutional neural network (CNN) with linear activations and binary weights. However, HCN's features are qualitatively very different.

研究动机与目标

  • 开发一种深度生成模型,无需监督即可从无标签二值图像中发现解耦的、分层的特征。
  • 解决具有解释性抵消现象的有向生成模型中的推理与学习挑战,此类问题对标准变分方法而言具有挑战性。
  • 通过统一的消息传递框架,实现特征与池化状态的联合学习,无需单独的EM阶段。
  • 证明该模型可通过简单地固定观测变量,支持灵活的任务(如分类、图像修复和半监督学习)。
  • 表明HCN在数据受损条件下泛化性能优于标准CNN,即使在极少标注数据下亦如此。

提出的方法

  • HCN使用包含与(AND)、或(OR)和池化(POOL)因子的有向因子图,在各层间分层组合特征,将图像生成建模为可重用二值部件的结构化组合。
  • 将特征视为隐变量而非固定参数,通过特定调度协议的最⼤乘积消息传递(MPMP)实现端到端的联合推理与学习。
  • MPMP通过在网络中传播证据,有效实现解释性抵消,克服了标准变分推理在深层有向模型中的局限性。
  • 该模型支持无监督与有监督学习:通过固定标签变量引入监督,推理过程保持不变。
  • HCN中的推理具有与使用线性激活和二值权重的CNN相同的函数形式,可通过单次前向传播实现快速分类。
  • 该架构采用固定池化(带小扰动)和二值权重,增强了可解释性与计算效率。

实验结果

研究问题

  • RQ1深度生成模型能否在无监督条件下,从未标注的二值图像中发现解耦的、可解释且可重用的部件(如字母或数字组件)?
  • RQ2最大乘积消息传递(MPMP)能否在具有解释性抵消效应的分层生成模型中,无需依赖EM或反向传播,有效实现联合推理与学习?
  • RQ3在数据受损条件下,HCN是否比标准CNN具有更好的泛化能力,尤其是在仅用极少数样本训练时?
  • RQ4通过简单地固定观测变量,是否可使相同的推理机制处理多样化任务(如分类、图像修复和半监督学习)?
  • RQ5HCN推理的函数形式是否等价于具有线性激活和二值权重的CNN?该等价性是否在速度或鲁棒性方面带来实际优势?

主要发现

  • HCN成功从未标注的单一图像中发现可解释的、组合性特征(如字母或数字组件),如图1所示。
  • 仅使用4张标注图像(每类一张),HCN在4分类任务中测试误差仅为0.6%,表明其在极小监督设置下的强大性能。
  • 在有监督训练中,HCN的测试误差为0.07%,显著优于标准CNN(0.5%误差)和ReLU激活的CNN(2.5%误差)。
  • 在受损MNIST数据上,HCN的泛化性能优于标准CNN:对于网格损坏,HCN误差为68.52% vs. CNN的82.69%;对于线条杂波,HCN误差为37.22% vs. CNN的55.77%。
  • HCN的训练时间随数据量和模型复杂度线性增长,在单个CPU上处理400张图像的MNIST数据集耗时约17小时,但消息存储的内存使用量可能高达150GB。
  • HCN第一层权重(图9a)清晰显示出数字的可重用部件,如笔画和曲线,证实了模型学习有意义分层特征的能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。