Skip to main content
QUICK REVIEW

[论文解读] NeXtVLAD: An Efficient Neural Network to Aggregate Frame-level Features for Large-scale Video Classification

Rongcheng Lin, Jing Xiao|arXiv (Cornell University)|Nov 12, 2018
Human Pose and Action Recognition参考文献 29被引用 5
一句话总结

NeXtVLAD 提出了一种参数高效的神经网络架构,通过分组注意力机制将高维帧级特征分解为低维向量,再应用基于 VLAD 的时序聚合,仅使用 79M 参数即在 YouTube-8M 基准上实现了最先进性能,私有 GAP 得分为 0.87846。

ABSTRACT

This paper introduces a fast and efficient network architecture, NeXtVLAD, to aggregate frame-level features into a compact feature vector for large-scale video classification. Briefly speaking, the basic idea is to decompose a high-dimensional feature into a group of relatively low-dimensional vectors with attention before applying NetVLAD aggregation over time. This NeXtVLAD approach turns out to be both effective and parameter efficient in aggregating temporal information. In the 2nd Youtube-8M video understanding challenge, a single NeXtVLAD model with less than 80M parameters achieves a GAP score of 0.87846 in private leaderboard. A mixture of 3 NeXtVLAD models results in 0.88722, which is ranked 3rd over 394 teams. The code is publicly available at https://github.com/linrongc/youtube-8m.

研究动机与目标

  • 解决 NetVLAD 参数效率低下的问题,后者会产生高维特征,需要庞大的分类头。
  • 通过减少大规模视频分类中的过拟合现象,提升训练效率与泛化能力。
  • 在计算与内存约束下,实现帧级特征到紧凑视频级表征的有效且快速聚合。
  • 以极小的模型规模实现与竞争模型相当的性能,并实现更快的收敛速度。

提出的方法

  • 使用可学习的注意力机制,将高维帧级特征分解为 G 个低维向量组。
  • 对每组独立应用 VLAD 聚合,以降低维度并提升特征紧凑性。
  • 通过拼接操作将分组后的 VLAD 输出整合为统一的视频级表征,并接入最终分类头。
  • 在各组之间共享注意力机制,以动态分配不同特征子空间的重要性。
  • 应用 Dropout 与归一化层,以提升泛化能力与训练稳定性。
  • 在集成模型中使用温度缩放(T=3)的知识蒸馏技术,以进一步提升性能。

实验结果

研究问题

  • RQ1将高维帧特征分解为分组的、注意力加权的子向量,是否能提升视频级表征学习的效率与效果?
  • RQ2与 NetVLAD 相比,所提出的 NeXtVLAD 架构在大规模视频分类中是否能减少过拟合并加速收敛?
  • RQ3在准确率与参数效率方面,更小的 NeXtVLAD 模型在多大程度上能超越更大的 NetVLAD 模型?
  • RQ4使用分组注意力与早期特征分解,对 YouTube-8M 数据集上的最终视频分类性能有何影响?
  • RQ5使用 NeXtVLAD 的集成模型是否能在参数增长极小的情况下实现最先进性能?

主要发现

  • 参数量为 55M 的 NeXtVLAD 在验证集上取得 GAP 得分为 0.8685,显著优于参数量更大的 NetVLAD 模型。
  • 仅含 79M 参数的单个 NeXtVLAD 模型在 YouTube-8M 挑战赛中取得私有 GAP 得分为 0.87846,排名 394 支队伍中的第 15 名。
  • 由三个 NeXtVLAD 模型组成的集成模型取得私有 GAP 得分为 0.88722,整体排名第三。
  • NeXtVLAD 模型收敛速度更快,且对过拟合的抵抗能力更强,在训练初期即展现出显著的性能提升。
  • 消融实验表明,知识蒸馏中使用温度缩放(T=3)可提升性能,尽管进一步调优可能带来更优结果。
  • 8 组(8G)配置的模型在参数量为 89M 时取得本地 GAP 得分为 0.8723,表明组数对性能与效率具有可测量的影响。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。