Skip to main content
QUICK REVIEW

[论文解读] HACS: Human Action Clips and Segments Dataset for Recognition and Temporal Localization

Hang Zhao, Antonio Torralba|arXiv (Cornell University)|Dec 26, 2017
Human Pose and Action Recognition参考文献 50被引用 8
一句话总结

HACS 引入了一个大规模视频数据集用于动作识别与时序定位,包含 150 万段剪辑视频(HACS Clips)和 13.9 万个在 5 万段未剪辑视频中密集标注的动作片段(HACS Segments)。该数据集利用视觉分类器之间的共识与分歧来挖掘高质量剪辑,作为预训练数据源实现了最先进性能,并因更短、更密集的片段标注而建立了细粒度动作定位的新基准。

ABSTRACT

This paper presents a new large-scale dataset for recognition and temporal localization of human actions collected from Web videos. We refer to it as HACS (Human Action Clips and Segments). We leverage both consensus and disagreement among visual classifiers to automatically mine candidate short clips from unlabeled videos, which are subsequently validated by human annotators. The resulting dataset is dubbed HACS Clips. Through a separate process we also collect annotations defining action segment boundaries. This resulting dataset is called HACS Segments. Overall, HACS Clips consists of 1.5M annotated clips sampled from 504K untrimmed videos, and HACS Seg-ments contains 139K action segments densely annotatedin 50K untrimmed videos spanning 200 action categories. HACS Clips contains more labeled examples than any existing video benchmark. This renders our dataset both a large scale action recognition benchmark and an excellent source for spatiotemporal feature learning. In our transferlearning experiments on three target datasets, HACS Clips outperforms Kinetics-600, Moments-In-Time and Sports1Mas a pretraining source. On HACS Segments, we evaluate state-of-the-art methods of action proposal generation and action localization, and highlight the new challenges posed by our dense temporal annotations.

研究动机与目标

  • 为解决缺乏大规模、密集时序动作定位数据集的问题,创建一个具有高标注密度和细粒度时间边界的基准。
  • 开发一种可扩展的自动化流水线,利用分类器共识与分歧挖掘高质量视频剪辑,减轻人工标注负担。
  • 将 HACS Clips 建立为强大的动作识别模型预训练数据源,其性能优于现有基准(如 Kinetics-600 和 Sports1M)。
  • 在 HACS Segments 上评估最先进动作提议与定位方法,揭示由更短、更密集动作片段带来的新挑战。
  • 提供一个与 ActivityNet 对齐的统一 200 类分类体系,支持跨基准的一致评估与迁移学习。

提出的方法

  • 使用视觉分类器进行自动化剪辑挖掘:基于多个模型之间的共识(高一致性)与分歧(预测差异)选择剪辑,以捕捉多样化且具有挑战性的样本。
  • 人机协同验证:由人工标注者验证挖掘出的剪辑,确保动作标签的准确性,从而构建包含 150 万段 2 秒剪辑的 HACS Clips 数据集。
  • 密集时序标注流水线:通过严格指南标注动作片段边界,减少歧义,使 HACS Segments 的片段数量比 ActivityNet 多 1.8 倍。
  • 使用标准化评估指标:动作提议生成采用 AR@100 和 tIoU 阈值(0.5–0.95)下的 AUC,动作定位采用 mAP。
  • 迁移学习实验:在 HACS Clips 上进行模型预训练,并在目标数据集(如 Kinetics、ActivityNet 等)上微调,以评估泛化性能。
  • 对负样本剪辑的消融研究:评估困难负样本(如存在人物但无动作)对动作提议生成模型特征学习的改善效果。

实验结果

研究问题

  • RQ1利用分类器共识与分歧进行自动化挖掘,能否有效识别出适合人工标注的高质量、多样化视频剪辑?
  • RQ2与现有基准(如 Kinetics-600、Moments-in-Time、Sports1M)相比,基于 HACS Clips 的预训练在动作识别迁移性能上表现如何?
  • RQ3HACS Segments 中标注的密度与时序精度相比 ActivityNet 提高了多少,从而显著增加了动作定位的难度?
  • RQ4最先进动作提议与定位模型在 HACS Segments 上的表现如何?该数据集揭示了哪些新挑战?
  • RQ5来自 HACS Clips 的困难负样本能否提升动作提议生成模型的鲁棒性?

主要发现

  • HACS Clips 包含来自 50.4 万段未剪辑视频的 150 万个标注剪辑,其规模是 Kinetics-600 的 2.5 倍,且在下游动作识别基准上作为预训练数据源优于 Kinetics-600。
  • 在三个目标数据集上,基于 HACS Clips 预训练的模型准确率均高于在 Kinetics-600、Moments-in-Time 或 Sports1M 上预训练的模型。
  • HACS Segments 包含 13.9 万个动作片段,分布在 5 万段视频中,片段数量是 ActivityNet 的 4.7 倍,视频数量是其 2.5 倍,且片段时长显著更短。
  • 在 HACS Segments Mini(1 万段训练视频)上进行动作提议生成,AR@100 达到 61.85,AUC 达到 51.59,显著低于 BSN 在 ActivityNet 上的表现,表明任务难度更高。
  • SSN 在 HACS Segments Mini 上的 mAP 为 15.93(ActivityNet 上为 28.28),而使用完整 HACS Segments 训练后 mAP 提升至 18.97,表明更大规模训练数据具有显著优势。
  • TAG 在高 tIoU(0.9)下的 AUC 高于 BSN 在 HACS Segments 上的表现,表明其边界定位精度更优,凸显了细粒度时间对齐的挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。