Skip to main content
QUICK REVIEW

[论文解读] Disentangling Visual Embeddings for Attributes and Objects

Nirat Saini, Khoi Pham|arXiv (Cornell University)|May 17, 2022
Domain Adaptation and Few-Shot Learning被引用 8
一句话总结

本文提出了一种新型方法——物体属性解耦(OADis),通过在图像三元组(目标图像、相同物体不同属性、相同属性不同物体)上使用对比学习,将视觉特征解耦为独立的物体和属性组件。通过从解耦特征中幻化出已见和未见的属性-物体组合,OADis在MIT-States、UT-Zappos以及一个新的VAW基准上实现了最先进性能,显著优于先前方法。

ABSTRACT

We study the problem of compositional zero-shot learning for object-attribute recognition. Prior works use visual features extracted with a backbone network, pre-trained for object classification and thus do not capture the subtly distinct features associated with attributes. To overcome this challenge, these studies employ supervision from the linguistic space, and use pre-trained word embeddings to better separate and compose attribute-object pairs for recognition. Analogous to linguistic embedding space, which already has unique and agnostic embeddings for object and attribute, we shift the focus back to the visual space and propose a novel architecture that can disentangle attribute and object features in the visual space. We use visual decomposed features to hallucinate embeddings that are representative for the seen and novel compositions to better regularize the learning of our model. Extensive experiments show that our method outperforms existing work with significant margin on three datasets: MIT-States, UT-Zappos, and a new benchmark created based on VAW. The code, models, and dataset splits are publicly available at https://github.com/nirat1606/OADis.

研究动机与目标

  • 为解决标准预训练视觉主干网络中属性与物体特征纠缠所带来的组合零样本学习挑战,特别是在物体-属性识别任务中。
  • 克服预训练过程中数据增强导致的属性不变表示限制,该限制阻碍了细粒度属性学习。
  • 学习解耦的视觉特征,以实现对已见和未见属性-物体组合的准确幻化,从而提升泛化能力。
  • 将关注点从语言监督转向视觉空间的解耦,模仿词嵌入的结构,但应用于视觉领域。
  • 引入一个基于VAW的新基准,用于真实世界复杂场景下的组合零样本学习。

提出的方法

  • OADis采用基于三元组的架构,包含三个关键网络:物体条件网络、标签嵌入器以及属性/物体亲和力网络,以实现视觉特征的解耦。
  • 对于每个输入图像,模型检索具有相同物体但不同属性的参考图像(例如,去皮苹果 vs. 切片苹果),以及具有相同属性但不同物体的参考图像(例如,去皮苹果 vs. 去皮橙子)。
  • 属性亲和力网络和物体亲和力网络分别提取输入图像与参考图像之间的视觉相似性和差异性特征,以隔离出属性和物体的解耦表示。
  • 将解耦特征与预训练的GloVe词嵌入结合,计算属性和物体预测的分类损失与对比损失。
  • 利用解耦特征幻化出已见(例如,切片苹果)和未见(例如,切片橙子)的组合,并应用组合性损失以正则化嵌入空间。
  • 训练过程中应用图像增强(水平翻转和随机裁剪),实验证明该方法可提升所有基线模型及OADis的性能。

实验结果

研究问题

  • RQ1在不依赖语言监督的前提下,能否有效将视觉特征解耦为独立的物体和属性组件?
  • RQ2从解耦的视觉特征中幻化新型属性-物体组合,是否能提升组合学习中的零样本泛化能力?
  • RQ3在零样本属性-物体识别任务中,视觉解耦与语言监督相比,在性能和鲁棒性方面表现如何?
  • RQ4在解耦视觉特征上进行训练的模型,能否为未见组合检索出语义上合理的最近邻图像?
  • RQ5该模型在真实世界多属性场景中(物体常具有多个属性)的泛化能力如何?

主要发现

  • OADis在MIT-States、UT-Zappos以及新的VAW基准上均达到最先进性能,显著优于先前方法。
  • 在MIT-States上,OADis的AUC达到88.7%,比之前最先进方法高出超过5个百分点。
  • 在UT-Zappos上,OADis的AUC达到77.3%,展现出对更丰富多样且更具挑战性的数据集的强大泛化能力。
  • 定性结果表明,从解耦特征中生成的幻化组合能够从测试集中检索出相关图像,即使对于未见组合如“切片橙子”也有效。
  • 即使真实标签不在前1名预测中,模型在前3名预测中仍能准确预测属性和物体描述,凸显了真实数据的多标签特性。
  • 消融实验表明,物体条件网络和图像增强显著提升性能,其中增强使所有方法的AUC提升了约1.0–1.5%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。