Skip to main content
QUICK REVIEW

[论文解读] Learning Hierarchical Visual Representations in Deep Neural Networks Using Hierarchical Linguistic Labels

Joshua C. Peterson, Paul Soulos|arXiv (Cornell University)|May 19, 2018
Face Recognition and Perception参考文献 18被引用 3
一句话总结

本文提出使用分层语言标签(具体而言,基本层级标签如“狗”和次级层级标签如“斑点狗”)对同一张图像进行训练,以学习更接近人类的视觉表征。通过引入多层级监督,模型学习到更丰富的分层结构,从而实现对感知上差异大但语义上相关类别更好的聚类效果,并展现出与人类认知模式高度一致的基本层级泛化偏差。

ABSTRACT

Modern convolutional neural networks (CNNs) are able to achieve human-level object classification accuracy on specific tasks, and currently outperform competing models in explaining complex human visual representations. However, the categorization problem is posed differently for these networks than for humans: the accuracy of these networks is evaluated by their ability to identify single labels assigned to each image. These labels often cut arbitrarily across natural psychological taxonomies (e.g., dogs are separated into breeds, but never jointly categorized as "dogs"), and bias the resulting representations. By contrast, it is common for children to hear both "dog" and "Dalmatian" to describe the same stimulus, helping to group perceptually disparate objects (e.g., breeds) into a common mental class. In this work, we train CNN classifiers with multiple labels for each image that correspond to different levels of abstraction, and use this framework to reproduce classic patterns that appear in human generalization behavior.

研究动机与目标

  • 探究使用分层语言标签(如“狗”和“斑点狗”)进行多层级监督是否能改善深度神经网络中的视觉表征学习。
  • 检验仅使用基本层级标签进行训练是否相比仅使用次级层级标签,能更好地捕捉视觉表征中的层级分类结构。
  • 评估仅使用基本层级标签训练的模型是否能复现心理学研究中观察到的人类类基本层级泛化偏差。
  • 确定多层级监督是否能增强模型对新样本泛化的能力,使其行为更接近人类认知模式。

提出的方法

  • 基于Szegedy等人(2015)的近最先进卷积神经网络,使用每张图像包含多个标签(对应分层分类体系中不同层级)的数据集进行微调。
  • 分别训练仅使用次级层级标签(Sub模型)、仅使用基本层级标签(Basic模型)或两者结合(Both模型)的模型,以比较其学习到的表征差异。
  • 使用分层聚类和树状图(dendrograms)评估学习到的表征在多大程度上反映数据的潜在分类结构。
  • 应用基于欧氏距离的概率泛化模型,并引入一种结合正样本数量(n)的归一化方案,以模拟类人泛化行为。
  • 对测试样本的泛化概率进行归一化,以实现与Xu & Tenenbaum(2007)人类数据的比较,重点关注相对似然性。
  • 从88/308个基本层级类别中采样训练和测试样本,每个类别至少包含三个次级类别,以确保泛化实验有足够的数据支持。

实验结果

研究问题

  • RQ1与仅使用次级层级标签训练相比,使用基本层级标签训练是否能带来更好的视觉表征分层聚类效果?
  • RQ2通过多层级监督学习到的表征在多大程度上与人类相似性判断和泛化模式相匹配?
  • RQ3仅使用基本层级标签训练的深度神经网络能否复现人类认知中观察到的基本层级泛化偏差?
  • RQ4观察到的样本数量如何影响模型中基本层级泛化偏差的强度?其变化趋势是否与人类行为一致?

主要发现

  • 使用基本层级标签训练的模型在聚类感知上差异大但语义上相关的样本(如不同犬种)方面表现显著优于仅使用次级层级标签训练的模型,这一结果在树状图中得到清晰体现。
  • 使用基本层级标签训练的模型在解释人类相似性判断方面,其泛化性能与仅使用次级层级标签的模型相当或更优。
  • 使用基本层级标签训练的模型表现出强烈的**基本层级泛化偏差**——即对将新标签泛化到更广泛类别(如“dax”泛化为所有狗)赋予非零概率——该偏差在样本数较少时增强,样本数较多时减弱,与人类行为高度一致。
  • 仅使用次级层级标签训练的Sub模型表现出微弱的基本层级偏差,表明仅靠感知相似性不足以诱导出稳健的分层泛化。
  • Both模型(同时使用两类标签)进一步提升了与人类泛化模式的匹配度,表明多层级监督能提升表征质量。
  • 在泛化模型方程中引入样本数量(n)显著提高了与人类数据的一致性,尤其在3个样本条件下,模型行为与人类趋势高度吻合。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。