Skip to main content
QUICK REVIEW

[论文解读] CLAD: A Complex and Long Activities Dataset with Rich Crowdsourced Annotations

Jawad Tayyub, Majd Hawasly|arXiv (Cornell University)|Jan 1, 2017
Human Pose and Action Recognition参考文献 13被引用 4
一句话总结

本论文介绍了CLAD,这是一个新颖的RGB-D视频数据集,记录了复杂、长时间的人类活动,数据源自移动机器人视角的Kinect 2传感器。该数据集采用亚马逊机械 Turk(Amazon Mechanical Turk)进行丰富的人工众包标注,通过结构化的任务设计与质量控制机制,确保在时间跨度长、真实世界场景下准确且自然语言风格的活动标注,从而为机器人学与计算机视觉领域中的长期活动识别提供基准测试数据。

ABSTRACT

An activity dataset is presented here which exhibits real-life and diverse scenarios of complex, temporally-extended human activities and actions. The dataset consists of a set of videos of actors performing everyday activities in a natural and unscripted manner. The dataset was recorded using a static Kinect 2 sensor which is commonly used on many robotic platforms. The dataset comprises of RGB-D images, point cloud data, automatically generated skeleton tracks in addition to crowdsourced annotations. We believe that this dataset is particularly suitable as a testbed for activity recognition research but it can also be applicable for other common tasks in robotics/computer vision research such as object detection and human skeleton tracking.

研究动机与目标

  • 解决在真实世界、机器人传感器感知环境下,长期、复杂人类活动缺乏标准化数据集的问题。
  • 提供一个通过静态Kinect 2传感器录制的基准数据集,以模拟移动机器人在日常环境中的感知能力。
  • 利用RGB-D视频与众包标注,支持长期活动识别、人体骨骼追踪及目标检测方面的研究。
  • 开发一种可扩展、低成本的众包流水线,用于收集长时间视频序列的高质量、自然语言标注。
  • 通过结构化的标注界面与质量控制机制,克服在标注时间跨度长、变量多且存在重叠的活动时所面临的挑战。

提出的方法

  • 在受控但自然的室内环境中,使用Kinect 2传感器录制了100多个日常生活活动(如进餐、学习、烹饪)的视频序列。
  • 为每个视频收集RGB-D图像、点云数据以及由Kinect 2传感器自动生成的人体骨骼轨迹。
  • 在亚马逊机械 Turk 上设计了定制的众包标注界面,包含三个主要组件:视频播放器、标注表格与时间轴可视化工具,用于活动标注。
  • 通过资格要求(至少20个已批准任务,且批准率≥90%)、时间限制(每1000帧任务不超过15分钟)以及奖励结构(对准确度与重叠活动检测给予奖金)实施质量控制。
  • 对每个任务设置最低标注阈值(根据视频长度动态调整),并对未达标提交者进行取消资格处理,以确保标注完整性。
  • 基于视频帧数对奖励与时间限制进行线性缩放,以在不同长度的任务间保持一致性与参与者的积极性。

实验结果

研究问题

  • RQ1如何在保持高质量与一致性的前提下,通过众包标注有效收集大规模、长时间的活动数据集?
  • RQ2在真实世界场景中,自然语言风格的众包标注在多大程度上能准确表示复杂、时间跨度长且存在重叠的人类活动?
  • RQ3在活动识别研究中,众包流水线的设计与参数选择应如何优化,以最大化长时间视频序列标注的质量与效率?
  • RQ4时间轴可视化工具的引入在多大程度上提升了众包标注中对重叠或并行活动的检测能力?
  • RQ5使用Kinect 2传感器从机器人视角录制的数据集,能否作为服务机器人领域长期活动识别的有效基准?

主要发现

  • CLAD数据集包含100多个复杂、长时间的日常活动视频序列,每个视频均配有RGB-D数据、点云与骨骼轨迹,数据来源为Kinect 2传感器。
  • 通过结构化界面在亚马逊机械 Turk 上完成众包标注,实现了标注质量与可扩展性之间的良好平衡。
  • 奖励模型(包括对准确度与重叠活动检测的奖金)成功激励了高质量标注,单个1000帧任务最高可获得3美元报酬。
  • 通过资格要求与未达标提交者取消资格机制,确保所有任务均达到最低标注阈值,显著提升了数据集的完整性。
  • 尽管引入了时间轴可视化工具,但未观察到标注质量的显著提升,表明当前形式下其效用有限。
  • 该数据集已公开发布,网址为 https://doi.org/10.5518/249,可作为机器人学与计算机视觉领域中长期活动识别、骨骼追踪与目标检测的基准数据集。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。