Skip to main content
QUICK REVIEW

[论文解读] A Short Note on the Kinetics-700 Human Action Dataset

João Carreira, Eric Noland|arXiv (Cornell University)|Jul 15, 2019
Anomaly Detection Techniques and Applications被引用 10
一句话总结

本文介绍了 Kinetics-700,这是 Kinetics 数据集的扩展版本,包含 700 种人类动作类别,每种类别至少包含 600 个来自不同 YouTube 视频的视频片段。该数据集在 Kinetics-600 的基础上,通过多语言查询扩展和改进的筛选流程,增加了新的、细粒度的以及文化多样的动作类别,使总视频片段数增加了 30%(达到 65 万)。在验证集上,基线 I3D-RGB 模型的 top-1 准确率为 58.7%,相较于之前版本,任务难度显著提升。

ABSTRACT

We describe an extension of the DeepMind Kinetics human action dataset from 600 classes to 700 classes, where for each class there are at least 600 video clips from different YouTube videos. This paper details the changes introduced for this new release of the dataset, and includes a comprehensive set of statistics as well as baseline results using the I3D neural network architecture.

研究动机与目标

  • 将 Kinetics 数据集从 600 个类别扩展至 700 个类别,同时保持高视频片段多样性与质量。
  • 通过多语言查询扩展,纳入更细粒度和文化多样的动作类别,以提升数据集的覆盖范围。
  • 通过保持严格的筛选协议并尽量减少与先前版本的类别重叠,确保新数据集在视频动作识别任务中仍具可扩展性。
  • 提供标准化的验证集和独立保留的测试集,以实现模型间的公平比较,支持未来在动作识别领域的基准测试。

提出的方法

  • 扩展了 Kinetics 的数据采集流程,引入多语言查询扩展,将类别名称翻译为法语、葡萄牙语和西班牙语,以提升候选视频的检索能力。
  • 使用视频元数据和标题的加权 n-gram 表示,实现跨多种语言的查询文本匹配,从而提升检索的准确率与多样性。
  • 实施了基于众包标注的人工验证流程,以确保视频片段的相关性与质量,同时过滤重复内容和低质量视频。
  • 严格区分训练集、验证集与测试集,并引入新的独立保留测试集,防止数据泄露,确保评估的公平性。
  • 保留了 Kinetics-600 中的 597 个类别,且 Kinetics-700 与 Kinetics-600 测试集之间的类别重叠率低于 3%,支持模型在两者之间的安全迁移。
  • 在 Kinetics-700 训练集上从头开始训练标准的 I3D-RGB 模型,采用带动量的 SGD 优化器与学习率衰减策略,并在验证集与测试集上进行评估。

实验结果

研究问题

  • RQ1将 Kinetics 数据集扩展至 700 个类别,对视频动作识别基准的可扩展性与多样性有何影响?
  • RQ2多语言查询扩展在提升新类别与细粒度动作类别的相关视频片段检索效果方面,其提升程度如何?
  • RQ3与 Kinetics-600 和 Kinetics-400 相比,标准模型(如 I3D-RGB)在 Kinetics-700 上的性能表现有何变化?
  • RQ4新筛选流程(包括人工验证与质量过滤)对数据集的整体难度与分布有何影响?
  • RQ5与先前版本相比,Kinetics-700 中引入全新独立保留测试集,对模型泛化能力与评估公平性有何影响?

主要发现

  • Kinetics-700 共包含 650,317 段总视频片段,分布在 700 个类别中,较 Kinetics-600 增加了 30%,且每个类别至少包含 600 段视频。
  • 使用 I3D-RGB 模型在验证集上达到 58.7% 的 top-1 准确率与 81.7% 的 top-5 准确率,表明相较于 Kinetics-600(top-1 为 71.7%)和 Kinetics-400(top-1 为 68.4%),任务难度显著提升。
  • 2019 年 ActivityNet Kinetics 挑战赛的冠军团队实现了 17.9% 的错误率,远优于基线 I3D-RGB 模型的 29.3% 错误率。
  • 由于引入了西班牙语和葡萄牙语查询,来自拉丁美洲的视频片段占比从 Kinetics-400 的 3% 上升至 Kinetics-700 的 8%,显著提升了地理多样性。
  • Kinetics-700 测试集与 Kinetics-600 测试集之间的类别重叠率低于 3%,允许在 Kinetics-700 上安全评估 Kinetics-600 模型,但反之则因训练集污染而不可行。
  • I3D 模型最难识别的类别包括 '处于零重力状态' 和 '制作滑溜物质',而最简单的类别为 '杂耍' 和 '打鼓',反映出模型在连续性高对比度动作上的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。