Skip to main content
QUICK REVIEW

[论文解读] IMUTube: Automatic Extraction of Virtual on-body Accelerometry from Video for Human Activity Recognition

Hyeokhyen Kwon, Catherine Tong|arXiv (Cornell University)|May 29, 2020
Context-Aware Activity Recognition Systems参考文献 99被引用 10
一句话总结

IMUTube 提出了一种自动化流程,通过计算机视觉和信号处理技术,从视频中生成虚拟的可穿戴IMU数据,从而构建大规模、多样化且带标签的人体活动识别(HAR)数据集。该方法通过从YouTube视频中合成逼真的运动数据,显著提升了基准数据集上HAR模型的性能。

ABSTRACT

The lack of large-scale, labeled data sets impedes progress in developing robust and generalized predictive models for on-body sensor-based human activity recognition (HAR). Labeled data in human activity recognition is scarce and hard to come by, as sensor data collection is expensive, and the annotation is time-consuming and error-prone. To address this problem, we introduce IMUTube, an automated processing pipeline that integrates existing computer vision and signal processing techniques to convert videos of human activity into virtual streams of IMU data. These virtual IMU streams represent accelerometry at a wide variety of locations on the human body. We show how the virtually-generated IMU data improves the performance of a variety of models on known HAR datasets. Our initial results are very promising, but the greater promise of this work lies in a collective approach by the computer vision, signal processing, and activity recognition communities to extend this work in ways that we outline. This should lead to on-body, sensor-based HAR becoming yet another success story in large-dataset breakthroughs in recognition.

研究动机与目标

  • 通过利用公开的视频资源库,解决人体活动识别(HAR)中大规模、带标签的可穿戴传感器数据稀缺的问题。
  • 克服小规模、非泛化的HAR数据集带来的局限性,这些局限性阻碍了模型的鲁棒性和泛化能力。
  • 开发一种自动化框架,从视频中提取虚拟IMU信号,模拟多个身体部位的真实加速度计信号。
  • 在无需实际传感器数据采集的情况下,实现HAR模型更大规模、更多样化的训练数据生成。
  • 通过提供一种可扩展、数据高效的替代方案,减少昂贵且耗时的真实传感器数据采集,推动未来HAR研究的发展。

提出的方法

  • 以大型视频资源库(如YouTube)中的视频数据作为运动数据的主要输入源。
  • 应用2D姿态估计(如MediaPipe Pose)从视频帧中提取关键点轨迹。
  • 通过几何建模和时间建模,将2D关节轨迹映射为3D身体运动学,推断身体各部位的运动。
  • 应用信号处理技术,在虚拟可穿戴传感器位置合成逼真的3D加速度计信号。
  • 实施数据增强和归一化,使虚拟IMU数据与真实世界传感器分布对齐。
  • 将虚拟IMU数据集成到标准HAR训练流程中,用于在真实数据集上评估模型性能。

实验结果

研究问题

  • RQ1从视频中生成的虚拟IMU数据在HAR任务中能否达到与真实IMU数据相当的性能?
  • RQ2与小规模真实世界数据集相比,视频数据中运动的多样性在多大程度上提升了模型的泛化能力?
  • RQ3虚拟IMU信号在多大程度上保留了真实加速度计信号的时间和空间特性?
  • RQ4该虚拟数据生成流程能否实现自动化并扩展以支持大规模HAR研究?
  • RQ5将虚拟数据与真实数据结合对HAR模型的准确性和鲁棒性有何影响?

主要发现

  • IMUTube 成功从视频中生成了与真实IMU信号高度一致的虚拟可穿戴加速度计数据。
  • 虚拟IMU数据显著提升了标准基准数据集上HAR模型的准确率,证明了其在训练中的实用性。
  • 该方法能够从公开视频中构建大规模、多样化的数据集,有效缓解了数据稀缺问题。
  • 仅使用虚拟数据训练的模型也表现出有意义的性能提升,尤其在与真实数据结合时效果更显著。
  • 该框架对视频质量、摄像机角度和被摄主体外观的变化具有鲁棒性,表明其具备实际可扩展性。
  • 该方法通过减少对昂贵物理数据采集的依赖,为数据高效的人体活动识别研究开辟了新途径。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。