Skip to main content
QUICK REVIEW

[论文解读] Deep Quantization: Encoding Convolutional Activations with Deep Generative Model

Zhaofan Qiu, Ting Yao|arXiv (Cornell University)|Nov 29, 2016
Human Pose and Action Recognition参考文献 40被引用 7
一句话总结

本文提出FV-VAE,一种新颖的端到端深度架构,将Fisher Vector编码与变分自编码器(VAE)相结合,用于量化卷积神经网络(CNN)中的激活值。通过训练VAE执行变分推断与学习,FV-VAE实现了灵活、数据自适应的表征学习,优于传统的基于高斯混合模型(GMM)的FV方法,在UCF101数据集上实现了94.2%的最先进准确率,用于视频动作识别。

ABSTRACT

Deep convolutional neural networks (CNNs) have proven highly effective for visual recognition, where learning a universal representation from activations of convolutional layer plays a fundamental problem. In this paper, we present Fisher Vector encoding with Variational Auto-Encoder (FV-VAE), a novel deep architecture that quantizes the local activations of convolutional layer in a deep generative model, by training them in an end-to-end manner. To incorporate FV encoding strategy into deep generative models, we introduce Variational Auto-Encoder model, which steers a variational inference and learning in a neural network which can be straightforwardly optimized using standard stochastic gradient method. Different from the FV characterized by conventional generative models (e.g., Gaussian Mixture Model) which parsimoniously fit a discrete mixture model to data distribution, the proposed FV-VAE is more flexible to represent the natural property of data for better generalization. Extensive experiments are conducted on three public datasets, i.e., UCF101, ActivityNet, and CUB-200-2011 in the context of video action recognition and fine-grained image classification, respectively. Superior results are reported when compared to state-of-the-art representations. Most remarkably, our proposed FV-VAE achieves to-date the best published accuracy of 94.2% on UCF101.

研究动机与目标

  • 解决现有方法中提取的卷积描述符与独立量化步骤之间存在的兼容性不足问题。
  • 克服Fisher Vector编码中高斯混合模型(GMM)的局限性,如对高斯分布的刚性假设以及在复杂数据簇上的泛化能力差。
  • 开发一种端到端可训练的框架,通过深度生成建模联合优化特征提取与量化过程。
  • 通过在FV-VAE架构中引入分类损失,保留训练过程中的语义信息。
  • 在VAE框架中通过重构损失梯度实现Fisher Vector表示的直接反向传播计算。

提出的方法

  • 提出两阶段深度架构:使用CNN主干网络进行特征提取,随后通过变分自编码器(VAE)实现Fisher Vector编码。
  • 通过使用识别网络建模潜在变量的后验分布,将Fisher Vector编码集成到VAE中,实现通过随机梯度下降的端到端训练。
  • 利用重构损失相对于潜在码的梯度作为Fisher Vector表示,实现可微分且高效的FV计算。
  • 通过联合损失函数端到端训练整个模型:包括VAE的重构损失和交叉熵分类损失,以保留语义信息。
  • 利用VAE的层次结构,比传统基于GMM的FV更灵活地建模复杂、非高斯的数据分布。
  • 通过聚合FV分量的绝对值,实现空间与时间注意力可视化,突出与识别相关的关键区域与帧。

实验结果

研究问题

  • RQ1能否将Fisher Vector编码有效集成到变分自编码器(VAE)等深度生成模型中,以提升表征学习性能?
  • RQ2用基于深度VAE的生成模型替代传统GMM,是否能带来在视觉识别任务中更好的泛化能力与性能表现?
  • RQ3是否能在VAE框架中通过反向传播直接计算Fisher Vector表示,从而实现端到端训练?
  • RQ4所提出的FV-VAE模型在视频动作识别与细粒度图像分类任务中,相较于最先进方法表现如何?
  • RQ5FV-VAE模型在多大程度上能通过注意力可视化突出语义相关的区域与时间帧?

主要发现

  • FV-VAE在UCF101数据集上的视频动作识别任务中实现了94.2%的新SOTA准确率,优于先前方法。
  • 该模型在视频动作识别(UCF101、ActivityNet)与细粒度图像分类(CUB-200-2011)任务中均表现出色,展现出广泛的迁移能力。
  • 特征可视化显示,FV-VAE学习到的空间注意力聚焦于鸟类的特征部位,如喙、颈部与翅膀,以及视频中的关键物体,如喷气快艇与磨刀器。
  • 时间注意力图显示,动作显著的帧(如驾驶喷气快艇或磨刀)得分更高,证实了模型定位关键时间事件的能力。
  • 将Fisher Vector表示定义为重构损失相对于潜在码的梯度,被证明在理论上合理且在下游识别任务中实际有效。
  • 基于VAE的生成模型相比GMM更具灵活性,能更好地捕捉卷积特征描述符的自然聚类与分布特性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。