Skip to main content
QUICK REVIEW

[论文解读] Okutama-Action: An Aerial View Video Dataset for Concurrent Human Action Detection

Mohammadamin Barekatain, Miquel Martí|arXiv (Cornell University)|Jun 9, 2017
Human Pose and Action Recognition参考文献 24被引用 13
一句话总结

本论文提出了 Okutama-Action,一个高分辨率的航拍视频数据集,包含43分钟的无人机拍摄画面,涵盖12种并发人类动作类别,具有动态过渡、多标签标注的参与者以及具有挑战性的相机运动。基于该数据集训练的SSD架构动作检测模型在960x540输入尺寸下达到18.80%的mAP,表明该数据集相较于现有基准具有更高的难度。

ABSTRACT

Despite significant progress in the development of human action detection datasets and algorithms, no current dataset is representative of real-world aerial view scenarios. We present Okutama-Action, a new video dataset for aerial view concurrent human action detection. It consists of 43 minute-long fully-annotated sequences with 12 action classes. Okutama-Action features many challenges missing in current datasets, including dynamic transition of actions, significant changes in scale and aspect ratio, abrupt camera movement, as well as multi-labeled actors. As a result, our dataset is more challenging than existing ones, and will help push the field forward to enable real-world applications.

研究动机与目标

  • 解决当前缺乏真实航拍视角视频数据集以支持并发人类动作检测的问题。
  • 构建一个能代表真实无人机应用场景的数据集,包含动态相机运动、尺度变化以及多参与者交互。
  • 提供一个基准,用于评估并推动在真实、复杂条件下动作检测模型的发展。
  • 支持航拍监控、搜救任务以及基于无人机的人类行为理解研究。
  • 促进开发能够处理多标签动作与复杂环境中长序列跟踪的模型。

提出的方法

  • 使用无人机在不同高度和角度下采集43分钟的高分辨率航拍视频序列。
  • 对12种动作类别进行时空边界框标注,并为每个参与者添加多标签标注。
  • 采用基于锚点预测的单阶段检测器(SSD)模型,基于RGB图像和光流输入进行动作检测。
  • 通过调整输入尺寸(512x512与960x540)及学习率调度策略,评估分辨率对性能的影响。
  • 在测试集上以0.5 IoU阈值计算平均平均精度(mAP)来评估模型性能。
  • 与UCF101、J-HMDB及其他数据集上的最先进模型进行对比,以验证本数据集的难度。

实验结果

研究问题

  • RQ1最先进动作检测模型在Okutama-Action上的表现与在现有数据集上的表现相比如何?
  • RQ2动态相机运动、尺度变化以及多标签动作在多大程度上增加了航拍视频中动作检测的难度?
  • RQ3提升输入分辨率是否能改善在具有复杂视觉挑战的航拍视频序列中的动作检测准确率?
  • RQ4动作的时序动态特性以及动作间的视觉相似性(如行走与跑步)对模型泛化能力有何影响?
  • RQ5现有的单标签检测模型能否有效处理Okutama-Action中的多标签动作标注?

主要发现

  • SSD模型在960x540输入分辨率下于Okutama-Action上达到18.80%的mAP,显著低于其在UCF101上报告的37.93% mAP。
  • 性能随输入分辨率提升而改善,mAP从512x512时的15.39%提升至960x540时的18.80%。
  • 光流输入仅带来6.47%的mAP,表明仅依靠运动特征不足以实现该数据集上的准确动作检测。
  • 具有强烈时序动态的动作(如行走与跑步)常被混淆,凸显时序区分的挑战。
  • 推与搬运等动作因存在大型外部物体而获得更高准确率,表明姿态之外的视觉线索至关重要。
  • 模型在45度相机视角下表现更优,因参与者占据更多像素,表明对分辨率与尺度变化敏感。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。