Skip to main content
QUICK REVIEW

[论文解读] Cross-Class Relevance Learning for Temporal Concept Localization

W. F. Mader, Satya Krishna Gorti|arXiv (Cornell University)|Nov 19, 2019
Human Pose and Action Recognition参考文献 41被引用 4
一句话总结

本文提出了一种新型成对模型——跨类别相关性学习(CCRL),通过联合编码视频片段与目标类别特征,以提升时序概念定位性能。通过引入类别特定特征并学习跨类别的共享相关性模式,CCRL在YouTube-8M视频理解挑战赛中以0.8329的mAP取得第一名,达到当前最先进水平。

ABSTRACT

We present a novel Cross-Class Relevance Learning approach for the task of temporal concept localization. Most localization architectures rely on feature extraction layers followed by a classification layer which outputs class probabilities for each segment. However, in many real-world applications classes can exhibit complex relationships that are difficult to model with this architecture. In contrast, we propose to incorporate target class and class-related features as input, and learn a pairwise binary model to predict general segment to class relevance. This facilitates learning of shared information between classes, and allows for arbitrary class-specific feature engineering. We apply this approach to the 3rd YouTube-8M Video Understanding Challenge together with other leading models, and achieve first place out of over 280 teams. In this paper we describe our approach and show some empirical results.

研究动机与目标

  • 解决大规模视频数据集中视频概念之间复杂且非互斥关系的建模挑战。
  • 克服标准分类头独立处理类别所带来的局限性,解决类别不平衡与过拟合问题。
  • 实现有效的类别特定特征工程,同时促进相关类别之间的信息共享。
  • 开发一种高效流水线,在不牺牲召回率的前提下减少候选片段数量,实现可扩展的推理。
  • 在YouTube-8M时序概念定位基准上实现最先进性能。

提出的方法

  • 提出一种成对二分类模型,以片段特征和目标类别特征作为输入,预测片段与类别的相关性。
  • 整合类别特定特征,如独热编码、层次嵌入以及从词袋描述中提取的相似性特征。
  • 使用梯度提升树(XGBoost)建模深度网络难以捕捉的非平滑、复杂类别关系。
  • 实施两阶段流水线:首先,视频级模型生成高召回率的候选片段;其次,仅对这些候选片段使用CCRL进行打分,以提升效率。
  • 利用Inception和基于VGG的模型提取的预训练特征作为视频和音频特征,并微调NetVLAD和NetFV以提升特征编码效果。
  • 通过多个模型的集成平均进一步提升性能,简单平均策略优于更复杂的融合方法。

实验结果

研究问题

  • RQ1联合建模片段-类别相关性与类别特定特征,能否提升在多样化、多标签视频概念上的定位性能?
  • RQ2跨类别信息共享在提升泛化能力方面有多有效,特别是在低资源或语义相似类别上?
  • RQ3候选片段生成流水线在多大规模视频定位任务中,能在多大程度上降低计算成本,同时保持高召回率?
  • RQ4将不可微的树基模型用于类别特征学习,是否能超越端到端深度学习,在捕捉复杂类别关系方面表现更优?
  • RQ5在多概念、多标签视频定位任务中,带有显式类别输入的成对模型是否能优于标准分类头?

主要发现

  • CCRL在YouTube-8M测试集上实现了0.8329的最高mAP,击败超过280支参赛团队,获得第一名。
  • 候选片段生成流水线将片段数量从约220万个减少至10万个,同时保持0.9969的召回率,几乎保留了所有相关片段。
  • 模型集成在候选片段生成后将mAP提升了最高20%,证明了将视频级知识迁移至定位任务的有效性。
  • 与标准LSTM基线相比,CCRL在语义相关类别(如汽车型号、电子产品)上表现出更一致的性能,后者在特定子类别上表现较差。
  • 即使作为独立模型,最佳CCRL模型也取得了排行榜第五名,表明其具备强大的独立部署能力。
  • 定性分析表明,CCRL能正确识别出LSTM模型误判的片段,例如将一名跌倒的滑板者正确识别为非‘滑板’行为。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。