Skip to main content
QUICK REVIEW

[论文解读] Self-Supervised Learning of a Biologically-Inspired Visual Texture Model

Nikhil Parthasarathy, Eero P. Simoncelli|arXiv (Cornell University)|Jun 30, 2020
Advanced Image and Video Retrieval Techniques参考文献 70被引用 4
一句话总结

该论文提出了一种受生物学启发的两阶段视觉纹理模型(V2Net),该模型使用固定的V1类滤波器,随后通过自监督学习训练V2类卷积滤波器,生成低维且具有不变性的纹理表征。该模型采用一种新型对比损失函数,最大化图像间响应的差异性,从而在纹理分类任务中实现了卓越的数据效率,并且其表征与灵长类V2神经元反应的相似性优于预训练的深度卷积神经网络(CNN)。

ABSTRACT

We develop a model for representing visual texture in a low-dimensional feature space, along with a novel self-supervised learning objective that is used to train it on an unlabeled database of texture images. Inspired by the architecture of primate visual cortex, the model uses a first stage of oriented linear filters (corresponding to cortical area V1), consisting of both rectified units (simple cells) and pooled phase-invariant units (complex cells). These responses are processed by a second stage (analogous to cortical area V2) consisting of convolutional filters followed by half-wave rectification and pooling to generate V2 'complex cell' responses. The second stage filters are trained on a set of unlabeled homogeneous texture images, using a novel contrastive objective that maximizes the distance between the distribution of V2 responses to individual images and the distribution of responses across all images. When evaluated on texture classification, the trained model achieves substantially greater data-efficiency than a variety of deep hierarchical model architectures. Moreover, we show that the learned model exhibits stronger representational similarity to texture responses of neural populations recorded in primate V2 than pre-trained deep CNNs.

研究动机与目标

  • 开发一种低维、受生物学启发的视觉纹理表征模型,以模拟灵长类V1和V2皮层的处理过程。
  • 通过利用基于新型对比损失的自监督学习,解决纹理分类中的数据效率挑战。
  • 提升人工模型与灵长类V2神经元群体表征之间的相似性,尤其针对中视觉处理阶段。
  • 探索一种参数化、在线学习的损失函数,使其比非参数化对比方法更具生物学合理性。
  • 弥合中视觉区域(如V2)在计算建模方面的空白,这些区域相较于早期和晚期视觉区域研究较少。

提出的方法

  • 该模型采用两阶段架构:第一阶段为固定的V1阶段,包含40个方向性Gabor类滤波器(4种方向 × 5种尺度 × 2种相位),通过半波整流和L2池化生成60个特征图,模拟复杂细胞反应。
  • 第二阶段为V2阶段,使用D=60个可学习的卷积滤波器处理V1输出,随后进行半波整流和空间L2池化,生成类似V2的复杂细胞响应。
  • 提出一种新型自监督对比损失函数,旨在最大化单张图像的V2响应分布与所有图像全局响应分布之间的距离。
  • 该损失函数基于V2响应的均值和协方差统计量进行参数化,支持在线、顺序更新,并在小样本场景下提升泛化能力。
  • 模型采用低维特征空间(60维)和基于二次变换的非线性解码器,以模拟视觉系统中的分层处理过程。
  • 模型在无标签的均匀纹理图像数据集上进行训练,未来计划通过引入局部空间一致性约束,扩展至自然场景学习。

实验结果

研究问题

  • RQ1一个具有固定V1滤波器和可学习V2滤波器的受生物学启发的两阶段模型,能否在纹理分类中实现高数据效率?
  • RQ2基于响应分布统计的自监督对比损失函数,是否能在小样本场景下提升表征学习性能?
  • RQ3所学习模型的表征与真实灵长类V2神经元反应模式的匹配程度如何?
  • RQ4一个低维、可解释的模型能否在与生物神经群体表征的相似性方面超越深度CNN?
  • RQ5与非参数化对比方法相比,参数化、在线学习的损失函数是否更符合生物学合理性,适用于分层视觉表征学习?

主要发现

  • 尽管特征空间维度较低(60维),V2Net模型在纹理分类任务中的数据效率显著优于多种深度分层架构。
  • 该模型在表征相似性上显著优于预训练的深度卷积神经网络,与灵长类V2神经元群体反应的匹配度更高。
  • 新型对比学习损失函数——通过最大化基于均值和协方差统计量的图像间响应差异性——在小样本训练下对实现高性能至关重要。
  • 将V1的简单细胞和复杂细胞响应同时作为V2阶段的输入,有助于学习鲁棒的纹理表征,具有功能性优势。
  • 该模型的参数化、在线学习机制支持生物合理的顺序更新,无需存储完整的全局数据分布。
  • 该方法在引入响应空间中的空间一致性约束后,有望扩展至分层模型和自然场景学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。