[论文解读] Learning Feature-to-Feature Translator by Alternating Back-Propagation for Generative Zero-Shot Learning
该论文提出了一种基于单一条件生成器并采用交替反向传播(ABP)训练的生成式零样本学习框架,用于将类别级语义特征与噪声映射到视觉特征,无需辅助网络即可实现最先进性能。在广义零样本学习中,其性能优于现有方法最高达4.0%,且对不完整的视觉特征具有强鲁棒性。
We investigate learning feature-to-feature translator networks by alternating back-propagation as a general-purpose solution to zero-shot learning (ZSL) problems. It is a generative model-based ZSL framework. In contrast to models based on generative adversarial networks (GAN) or variational autoencoders (VAE) that require auxiliary networks to assist the training, our model consists of a single conditional generator that maps class-level semantic features and Gaussian white noise vector accounting for instance-level latent factors to visual features, and is trained by maximum likelihood estimation. The training process is a simple yet effective alternating back-propagation process that iterates the following two steps: (i) the inferential back-propagation to infer the latent factors of each observed example, and (ii) the learning back-propagation to update the model parameters. We show that, with slight modifications, our model is capable of learning from incomplete visual features for ZSL. We conduct extensive comparisons with existing generative ZSL methods on five benchmarks, demonstrating the superiority of our method in not only ZSL performance but also convergence speed and computational cost. Specifically, our model outperforms the existing state-of-the-art methods by a remarkable margin up to 3.1% and 4.0% in ZSL and generalized ZSL settings, respectively.
研究动机与目标
- 解决零样本学习(ZSL)中未见类别缺乏训练数据的挑战。
- 消除生成式ZSL模型中对判别器(GAN)或编码器(VAE)等辅助网络的需求。
- 基于后验分布不可计算的最大似然估计,开发一种简单、高效且有效的训练方法。
- 实现从不完整视觉特征中鲁棒学习,此类情况在现实场景中常见。
- 相比现有生成式ZSL框架,提升收敛速度与计算效率。
提出的方法
- 该模型使用单一条件生成器,将类别级语义特征与高斯噪声映射到视觉特征,充当特征到特征的转换器。
- 训练采用交替反向传播(ABP)算法,通过迭代执行推理反向传播与学习反向传播步骤。
- 在推理反向传播中,通过MCMC采样使用Langevin动力学推断潜在因子,并通过反向传播计算梯度。
- 在学习反向传播中,利用推断出的潜在因子通过对数似然的梯度上升法更新模型参数。
- 该方法基于最大似然估计并采用类似EM的策略,避免了对抗训练或变分推断的需求。
- 通过在推理过程中将缺失值视为潜在变量,使框架能够适应不完整的视觉特征。
实验结果
研究问题
- RQ1通过最大似然估计训练的单一条件生成器是否能在无需辅助网络的情况下实现零样本学习的最先进性能?
- RQ2与对抗训练或变分训练相比,交替反向传播算法在收敛性和稳定性方面表现如何?
- RQ3当视觉特征部分缺失时,模型的泛化能力在多大程度上仍保持有效?
- RQ4随着已见类别数量的增加(反映现实中的类别不平衡),模型的性能表现如何?
- RQ5在极少标注数据的前提下,模型能否生成高质量的合成视觉特征以用于未见类别?
主要发现
- 所提方法在基准数据集上相较之前最先进方法,在广义零样本学习准确率上提升了最高4.0%。
- 在CUB数据集上,仅使用每未见类别一个合成样本时,模型达到50.1%的top-1准确率,显著优于FGZSL(29.1%)和VZSL。
- 当每类生成300个合成样本时,性能趋于饱和,表明生成质量稳定且一致。
- 在高缺失率下模型保持强性能:当90%的视觉特征缺失时,准确率达51.6%,显著优于GAZSL(37.7%)。
- 由于无需辅助网络,与基于GAN和VAE的方法相比,该模型以更少参数和更低计算成本实现更优性能。
- 在广义ZSL中,随着已见类别数量增加,模型在未见类别(A_U)上保持高准确率,同时在已见类别(A_S)上性能仍可接受,展现出强鲁棒泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。