Skip to main content
QUICK REVIEW

[论文解读] RGB-D-based Action Recognition Datasets: A Survey

Jing Zhang, Wanqing Li|arXiv (Cornell University)|Jan 21, 2016
Human Pose and Action Recognition参考文献 88被引用 7
一句话总结

本文全面综述了44个公开可用的RGB-D动作识别数据集——27个单视角、10个多视角和7个多人交互数据集——详细说明了其规格、应用场景及评估协议。文章指出了当前评估实践中的局限性,并倡导采用跨数据集评估和显著性检验,以实现在真实场景中更公平、更真实的算法基准测试。

ABSTRACT

Human action recognition from RGB-D (Red, Green, Blue and Depth) data has attracted increasing attention since the first work reported in 2010. Over this period, many benchmark datasets have been created to facilitate the development and evaluation of new algorithms. This raises the question of which dataset to select and how to use it in providing a fair and objective comparative evaluation against state-of-the-art methods. To address this issue, this paper provides a comprehensive review of the most commonly used action recognition related RGB-D video datasets, including 27 single-view datasets, 10 multi-view datasets, and 7 multi-person datasets. The detailed information and analysis of these datasets is a useful resource in guiding insightful selection of datasets for future research. In addition, the issues with current algorithm evaluation vis-á-vis limitations of the available datasets and evaluation protocols are also highlighted; resulting in a number of recommendations for collection of new datasets and use of evaluation protocols.

研究动机与目标

  • 为解决RGB-D动作识别数据集缺乏全面综述的问题,以促进算法开发中的数据集选择。
  • 识别并分析现有RGB-D数据集的关键特征,包括动作类别、受试者数量、采集设置和环境因素。
  • 评估当前的评估协议并指出其局限性,例如对固定背景和视角的过拟合。
  • 推荐改进的评估方案——特别是跨数据集评估和显著性检验——以提升算法比较的公平性和真实性。
  • 通过识别空白并提出更强大、多样化和具有代表性的数据集要求,指导未来数据集的创建。

提出的方法

  • 系统性地将44个公开可用的RGB-D数据集分类并总结为三类:单视角、多视角和多人交互数据集。
  • 收集并分析每个数据集的详细元数据,包括动作数量、受试者数量、重复次数、视频样本、采集设置和环境条件。
  • 评估常用的评估协议,如留一主体法、跨主体、跨视角和跨环境验证,识别其局限性。
  • 提出一种跨数据集评估方案,其中训练和测试数据来自不同数据集,涵盖不同的演员、视角和环境,以模拟真实世界部署。
  • 倡导在性能报告中纳入显著性检验,以确保算法间比较的可靠性。
  • 提供对所调研数据集中最先进结果的综合总结,以支持基准测试和算法配置。

实验结果

研究问题

  • RQ1在最广泛使用的RGB-D动作识别数据集中,其关键特征和差异是什么?
  • RQ2当前的评估协议(如留一主体法)在多大程度上限制了动作识别算法的泛化能力和真实世界适用性?
  • RQ3背景、视角和演员位置在多大程度上影响算法性能,如何在评估中缓解这一影响?
  • RQ4现有RGB-D数据集在环境多样性、动作变化和真实世界真实性方面存在哪些局限性?
  • RQ5如何改进未来的评估协议,以更好地反映真实世界部署场景并确保算法比较的公平性?

主要发现

  • 现有大多数RGB-D数据集局限于固定视角、受控背景和一致的演员位置,可能导致算法依赖虚假线索。
  • 如留一主体法和跨主体验证等评估协议由于固定摄像机和背景配置,容易导致过拟合,限制泛化能力。
  • 跨数据集评估——即训练和测试数据来自不同数据集,涵盖不同的演员、视角和环境——提供了更真实的基准测试场景。
  • 当前基准测试实践通常报告多次运行的平均性能,但缺乏显著性检验,可能导致算法比较产生误导。
  • 在所调研数据集上的最先进性能已趋于平稳,表明现有数据集过于简单,已导致算法的饱和。
  • 迫切需要创建包含更大环境多样性、动作变化和真实世界复杂性的新数据集,以推动RGB-D动作识别的进一步发展。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。