Skip to main content
QUICK REVIEW

[论文解读] Do Less and Achieve More: Training CNNs for Action Recognition Utilizing Action Images from the Web

Shugao Ma, Sarah Adel Bargal|arXiv (Cornell University)|Dec 22, 2015
Human Pose and Action Recognition参考文献 26被引用 4
一句话总结

本文提出利用从网络爬取并经人工筛选的动作图像,显著提升使用卷积神经网络(CNN)进行视频动作识别的性能,从而减少对大规模视频数据集的依赖。通过同时使用视频和具有判别性的动作图像(尤其是来自筛选或未筛选的网络来源)进行训练,该方法在UCF101数据集上实现了91.1%的最先进准确率,相较于仅使用视频训练的性能绝对提升高达10.5%,即使将ActivityNet的1620万帧视频数据中的50%替换为仅39.3万张图像,也能取得相近性能。

ABSTRACT

Recently, attempts have been made to collect millions of videos to train CNN models for action recognition in videos. However, curating such large-scale video datasets requires immense human labor, and training CNNs on millions of videos demands huge computational resources. In contrast, collecting action images from the Web is much easier and training on images requires much less computation. In addition, labeled web images tend to contain discriminative action poses, which highlight discriminative portions of a video's temporal progression. We explore the question of whether we can utilize web action images to train better CNN models for action recognition in videos. We collect 23.8K manually filtered images from the Web that depict the 101 actions in the UCF101 action video dataset. We show that by utilizing web action images along with videos in training, significant performance boosts of CNN models can be achieved. We then investigate the scalability of the process by leveraging crawled web images (unfiltered) for UCF101 and ActivityNet. We replace 16.2M video frames by 393K unfiltered images and get comparable performance.

研究动机与目标

  • 探究从网络获取的动作图像是否能显著提升基于CNN的视频动作识别性能。
  • 降低为训练收集大规模视频数据集所带来的人力与计算成本。
  • 探索使用未经筛选、网络爬取的图像作为视频帧替代品的可扩展性与有效性。
  • 评估网络图像是否能为视频数据提供互补信息,从而增强模型泛化能力。
  • 构建并发布目前最大规模的动作图像数据集,与UCF101和ActivityNet实现一一对应,供公众研究使用。

提出的方法

  • 作者收集了23.8K张经人工筛选的网络图像,涵盖101种UCF101动作类别,确保图像质量高且具有判别性。
  • 在视频帧与动作图像的组合数据上训练深层空间CNN(如VGG16、VGG19),以提升特征学习能力。
  • 为实现可扩展性,从网络爬取39.3万张未经筛选的图像用于UCF101与ActivityNet,用以替换部分训练视频帧。
  • 比较使用筛选与未筛选图像的性能表现,并评估不同模型深度与数据比例下的准确率增益。
  • 在UCF101与ActivityNet上采用标准评估协议,包括mAP与top-1准确率,评估是否使用光流特征。
  • 通过消融实验,分离出网络图像对性能的独立贡献,排除模型深度与运动特征的影响。

实验结果

研究问题

  • RQ1从网络捕获的动作图像是否能显著提升基于CNN的视频动作识别性能?
  • RQ2使用网络图像是否能在不损失准确率的前提下,减少对大规模视频数据集的需求?
  • RQ3在性能与可扩展性方面,筛选与未筛选的网络图像相比如何?
  • RQ4随着网络图像数量的增加,性能提升的边际收益如何变化?
  • RQ5网络图像是否能为视频数据提供互补信息,特别是在结合运动特征时?

主要发现

  • 在UCF101上,仅使用视频与23.8K张筛选后的网络图像训练空间CNN,准确率达到83.5%,相较于仅使用视频训练的性能绝对提升10.5%。
  • 当结合运动特征(IDT-FV)时,模型在UCF101上的准确率达到91.1%,为迄今报告的最高结果。
  • 将ActivityNet的1620万帧视频数据中的50%替换为39.3万张未筛选的网络图像,性能表现相近(mAP为46.3% vs. 全量视频集的47.7%)。
  • 随着图像数量的增加,网络图像带来的性能增益逐渐减小,表明在某一阈值后出现饱和现象。
  • 该方法在不同CNN架构下均表现稳健,即使在像ActivityNet这样规模极大的视频数据集上也依然有效。
  • 使用网络图像带来的性能增益,相当于在CNN中增加9层以上或引入复杂运动建模,且不增加推理成本。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。