Skip to main content
QUICK REVIEW

[论文解读] Semantic Embedding Space for Zero-Shot Action Recognition

Xun Xu, Timothy M. Hospedales|arXiv (Cornell University)|Feb 5, 2015
Human Pose and Action Recognition参考文献 10被引用 17
一句话总结

该论文提出了一种语义嵌入空间(SES)框架,用于零样本视频动作识别,利用 word2vec 将动作标签映射到共享向量空间,并使用支持向量回归将视频特征投影到该空间。通过在 HMDB51 和 UCF101 上结合自训练和数据增强,该方法在零样本识别中达到最先进性能(HMDB51 上为 21.2%,UCF101 上为 18.6%),显著优于以往基于属性和基线 SES 的方法。

ABSTRACT

The number of categories for action recognition is growing rapidly. It is thus becoming increasingly hard to collect sufficient training data to learn conventional models for each category. This issue may be ameliorated by the increasingly popular 'zero-shot learning' (ZSL) paradigm. In this framework a mapping is constructed between visual features and a human interpretable semantic description of each category, allowing categories to be recognised in the absence of any training data. Existing ZSL studies focus primarily on image data, and attribute-based semantic representations. In this paper, we address zero-shot recognition in contemporary video action recognition tasks, using semantic word vector space as the common space to embed videos and category labels. This is more challenging because the mapping between the semantic space and space-time features of videos containing complex actions is more complex and harder to learn. We demonstrate that a simple self-training and data augmentation strategy can significantly improve the efficacy of this mapping. Experiments on human action datasets including HMDB51 and UCF101 demonstrate that our approach achieves the state-of-the-art zero-shot action recognition performance.

研究动机与目标

  • 为应对由于动作类别复杂性迅速增加和数据采集成本上升而导致的在无任何训练数据情况下识别新视频动作的挑战。
  • 将语义嵌入空间(SES)范式——此前主要应用于图像识别——扩展至视频动作识别,其中视觉-语义映射更为复杂。
  • 通过提升视觉到语义空间回归的鲁棒性和可迁移性,克服零样本视频识别中的域偏移和泛化挑战。
  • 证明简单的自训练和数据增强策略可显著提升基于 SES 的零样本动作识别性能。
  • 在零样本和传统多样本学习设置下验证该框架,表明其在监督设置下也具有竞争力。

提出的方法

  • 使用在 1000 亿词语料上预训练的 word2vec 将类别名称嵌入到 $d_z$-维语义空间中,多词标签通过平均合并为单一向量。
  • 采用支持向量回归(SVR)学习从低层次时空特征(如 MBH、HOG)到语义嵌入空间的映射 $f: x \to z$。
  • 通过在目标数据集(如 HMDB51)和辅助数据集(如 UCF101)上联合训练 SVR 实现数据增强,提升跨域泛化能力。
  • 引入自训练机制,利用初始回归器的预测结果,对语义空间中的原型表示进行优化,提升未见类别实例与原型之间的对齐程度。
  • 使用 t-SNE 可视化定性验证:增强数据和自训练可使未见类别样本在语义空间中更紧密地聚集于其原型周围。
  • 在零样本和多样本评估中均采用标准训练/测试划分,通过在语义空间中进行最近邻匹配实现分类。

实验结果

研究问题

  • RQ1尽管将时空特征映射到语义向量存在复杂性,语义嵌入空间是否能有效用于零样本视频动作识别?
  • RQ2在多个数据集(如 HMDB51 和 UCF101)之间进行数据增强,如何提升视觉到语义回归器在零样本识别中的泛化能力?
  • RQ3自训练在多大程度上能优化语义空间中的原型表示,从而提升对未见动作类别的识别性能?
  • RQ4与传统的基于属性的 ZSL 方法相比,所提出的基于 SES 的方法在零样本准确率和可扩展性方面表现如何?
  • RQ5相同的语义嵌入框架是否也能在标准多样本监督动作识别中实现具有竞争力的性能?

主要发现

  • 所提方法在 HMDB51 上实现了最先进零样本动作识别性能,平均准确率为 21.2% ± 3.0%,显著优于基线 NN 方法(15.0% ± 3.0%)和基于属性的方法(DAP:UCF101 上为 14.3% ± 1.9%)。
  • 在 UCF101 上,该方法达到 18.6% ± 2.2% 的零样本准确率,超过 NN+ST 基线(15.8% ± 2.3%)和 DAP 方法(14.3% ± 1.9%)。
  • 数据增强与自训练的结合(NN+ST+Aux)性能最高,表明两种策略对提升未见动作类别上的鲁棒泛化能力均至关重要。
  • 定性 t-SNE 可视化证实,数据增强可减少未见类别实例与其原型在语义空间中的距离,而自训练进一步改善了原型对齐。
  • 在多样本学习中,该方法在 HMDB51 上达到 44.5% 的准确率,在 UCF101 上达到 73.7%,与基于低层次特征的最先进方法(HMDB51 上为 47.2%)具有竞争力,且优于基于属性的方法(UCF101 上为 69.7%)。
  • 结果表明,当与自训练和数据增强结合时,语义嵌入空间是基于属性的 ZSL 的可扩展且高效的替代方案,尤其适用于复杂视频动作。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。