Skip to main content
QUICK REVIEW

[论文解读] SR-GAN: Semantic Rectifying Generative Adversarial Network for Zero-shot Learning

Zihan Ye, Fan Lyu|arXiv (Cornell University)|Apr 15, 2019
Domain Adaptation and Few-Shot Learning参考文献 27被引用 8
一句话总结

本文提出SR-GAN,一种用于零样本学习的语义校正生成对抗网络,通过语义校正网络(SRN)将模糊的语义特征精炼为更具判别性的空间,从而提升泛化能力。通过从校正后的语义生成逼真的视觉特征,并利用预重建和后重建网络保持一致性,SR-GAN在四个基准数据集上实现了最先进性能,在零样本学习(ZSL)和广义零样本学习(GZSL)设置下显著优于先前方法,尤其有效降低了可见类与未见类之间的准确率偏差。

ABSTRACT

The existing Zero-Shot learning (ZSL) methods may suffer from the vague class attributes that are highly overlapped for different classes. Unlike these methods that ignore the discrimination among classes, in this paper, we propose to classify unseen image by rectifying the semantic space guided by the visual space. First, we pre-train a Semantic Rectifying Network (SRN) to rectify semantic space with a semantic loss and a rectifying loss. Then, a Semantic Rectifying Generative Adversarial Network (SR-GAN) is built to generate plausible visual feature of unseen class from both semantic feature and rectified semantic feature. To guarantee the effectiveness of rectified semantic features and synthetic visual features, a pre-reconstruction and a post reconstruction networks are proposed, which keep the consistency between visual feature and semantic feature. Experimental results demonstrate that our approach significantly outperforms the state-of-the-arts on four benchmark datasets.

研究动机与目标

  • 为解决零样本学习中语义属性重叠、模糊的问题,该问题阻碍了对未见类别的准确分类。
  • 通过利用视觉数据引导,学习一个校正后的语义空间,以提升语义特征的判别能力。
  • 利用基于生成对抗网络的框架并施加重建约束,生成更具真实感和一致性的未见类别视觉特征。
  • 通过保持语义-视觉一致性,减少广义零样本学习(GZSL)中的可见-未见准确率偏差。

提出的方法

  • 训练一个语义校正网络(SRN),利用语义损失和校正损失,结合已见视觉特征,将原始模糊语义特征映射到更具判别性的空间。
  • 语义校正生成对抗网络(SR-GAN)从原始和校正后的语义特征生成合成视觉特征,利用生成对抗网络判别器确保生成结果的真实性。
  • 预重建网络通过从生成输出中重建视觉特征,确保生成器学习到视觉特征的精确分布。
  • 后重建网络将合成视觉特征反向转换回语义空间,保持语义一致性并提升特征保真度。
  • 通过双重建路径在视觉空间与语义空间之间强制实现循环一致性,提升特征对齐与泛化能力。
  • 模型通过端到端联合优化语义校正、生成对抗网络生成和重建损失进行训练。

实验结果

研究问题

  • RQ1学习到的语义校正过程是否能提升零样本学习中语义特征的判别能力?
  • RQ2在生成前对语义特征进行校正,是否能提升为未见类别生成的视觉特征的真实感与实用性?
  • RQ3施加预重建与后重建一致性约束在多大程度上能提升零样本学习中的泛化能力?
  • RQ4与现有方法相比,所提方法是否能有效降低广义零样本学习中的可见-未见准确率偏差?
  • RQ5该框架是否能在多样化的零样本学习基准上实现最先进性能?

主要发现

  • SR-GAN在四个基准数据集(AWA1、CUB、APY和SUN)上实现了新的最先进性能,尤其在广义零样本学习(GZSL)中表现突出。
  • 在GZSL设置下,SR-GAN在所有数据集上均达到最高的调和平均值(H),在AWA1上未见类别准确率(U)相比先前方法提升了14.71%。
  • 该模型显著降低了可见-未见准确率偏差,在保持高可见类别准确率(S)的同时,将未见类别准确率(U)最高提升了14.71%,表明泛化能力更强。
  • 消融实验表明,SRN与重建网络均至关重要:在AWA1上移除SRN会使U下降1.01%;若移除重建机制,性能进一步下降。
  • 通过MDS可视化证实,SRN能有效分离语义空间中重叠的类别(如狼、猫、狗),使其更具可区分性。
  • 后重建网络确保合成视觉特征保持语义一致性,从而维持语义表征的完整性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。