Skip to main content
QUICK REVIEW

[论文解读] Gaze Embeddings for Zero-Shot Image Classification

Nour Karessli, Zeynep Akata|arXiv (Cornell University)|Nov 28, 2016
Domain Adaptation and Few-Shot Learning参考文献 36被引用 4
一句话总结

本文提出将人类注视数据作为零样本图像分类的辅助信息,引入三种新颖的注视嵌入方法——注视直方图(GH)、基于网格的注视特征(GFG)和基于序列的注视特征(GFS),以捕捉具有类别区分性的视觉注意力。该方法在细粒度数据集上优于专家标注的属性和基线方法,表明非专家的注视数据是零样本学习中一种具有竞争力且低成本的替代方案。

ABSTRACT

Zero-shot image classification using auxiliary information, such as attributes describing discriminative object properties, requires time-consuming annotation by domain experts. We instead propose a method that relies on human gaze as auxiliary information, exploiting that even non-expert users have a natural ability to judge class membership. We present a data collection paradigm that involves a discrimination task to increase the information content obtained from gaze data. Our method extracts discriminative descriptors from the data and learns a compatibility function between image and gaze using three novel gaze embeddings: Gaze Histograms (GH), Gaze Features with Grid (GFG) and Gaze Features with Sequence (GFS). We introduce two new gaze-annotated datasets for fine-grained image classification and show that human gaze data is indeed class discriminative, provides a competitive alternative to expert-annotated attributes, and outperforms other baselines for zero-shot image classification.

研究动机与目标

  • 为解决零样本图像分类中收集专家标注属性所面临的高成本和高专业性要求。
  • 探究从非专家中收集的注视数据是否可作为零样本学习中属性的可行且低成本的替代方案。
  • 提出一种新型数据收集范式,通过在两类之间进行区分任务来增强注视信息的内容。
  • 设计并评估三种新的注视嵌入方法,从注视点序列中提取区分性特征。
  • 证明基于注视的零样本学习在不同细粒度数据集上的泛化能力,而不仅限于初始训练领域。

提出的方法

  • 提出一种注视数据收集范式:观察者并排查看两类图像,并对第三张图像执行二分类任务,以促使注意力集中在具有区分性的物体部分。
  • 引入三种注视嵌入方法:注视直方图(GH)用于捕捉注视点的空间分布,基于网格的注视特征(GFG)用于提取空间与时间特征,基于序列的注视特征(GFS)用于捕捉注视点的序列模式。
  • 采用结构化的联合嵌入框架,学习深度图像特征与注视嵌入之间的兼容性,以实现零样本分类。
  • 在零样本学习设置中应用注视嵌入,通过利用注视作为辅助信号,学习图像特征与类别嵌入之间的映射关系。
  • 使用眼动追踪数据提取注视点,并基于空间分布、凝视时长和序列顺序构建嵌入。
  • 在CUB和PET数据集上采用标准的零样本学习协议进行性能验证,包含多次零样本划分和重复实验。

实验结果

研究问题

  • RQ1非专家的注视数据能否作为零样本图像分类的有效辅助信息?
  • RQ2注视嵌入在零样本分类性能上与专家标注属性及其他基线方法相比如何?
  • RQ3基于区分任务的数据收集范式是否相比被动观看能提升注视数据的区分质量?
  • RQ4注视嵌入能否在不同细粒度数据集(如CUB和牛津宠物数据集)之间实现泛化?
  • RQ5在区分视觉上相似的类别(如形状相似但颜色不同的猫品种)时,基于注视的嵌入存在哪些局限性?

主要发现

  • 非专家的注视数据具有高度的类别区分性,在PET数据集上实现了46.6%的零样本准确率,显著优于随机基线(16%)和词袋模型基线(21.0%)。
  • 在CUB-VW数据集上,注视嵌入优于专家标注属性和基于鼠标点击的“气泡”数据,证明其作为辅助信号的优越性。
  • 注视嵌入在细粒度鸟类分类任务中表现优异,能将“黑顶黄莺”图像排在前三名,而属性和词袋方法因文本语义相似性而出现错误。
  • 定性分析显示,注视嵌入很少混淆猫和狗,而词袋表示则频繁混淆,凸显注视方法对语义模糊性的鲁棒性。
  • 失败案例出现在区分视觉上相似的类别时(如阿比西尼亚猫与俄罗斯蓝猫),此时注视无法编码颜色差异,表明其在捕捉非空间视觉属性方面存在局限。
  • 结果表明,注视嵌入在零样本学习中有效且具备跨领域泛化能力,但通过领域特定的数据收集或对注视嵌入参数进行微调,性能或可进一步提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。