Skip to main content
QUICK REVIEW

[论文解读] Multi-Stage Based Feature Fusion of Multi-Modal Data for Human Activity Recognition

Hyeongju Choi, Apoorva Beedu|arXiv (Cornell University)|Nov 8, 2022
Human Pose and Action Recognition被引用 4
一句话总结

该论文提出了一种两阶段多模态框架,通过融合RGB视频和IMU传感器数据进行人体活动识别,采用3D-CNN和1D-CNN编码器,随后进行特征融合与分类。在UTD-MHAD数据集上达到96.05%的准确率,在MMAct数据集上达到84.05%,分别比单模态基线模型高出22%和11%,并在低数据量和零样本设置下表现出强鲁棒性。

ABSTRACT

To properly assist humans in their needs, human activity recognition (HAR) systems need the ability to fuse information from multiple modalities. Our hypothesis is that multimodal sensors, visual and non-visual tend to provide complementary information, addressing the limitations of other modalities. In this work, we propose a multi-modal framework that learns to effectively combine features from RGB Video and IMU sensors, and show its robustness for MMAct and UTD-MHAD datasets. Our model is trained in two-stage, where in the first stage, each input encoder learns to effectively extract features, and in the second stage, learns to combine these individual features. We show significant improvements of 22% and 11% compared to video only and IMU only setup on UTD-MHAD dataset, and 20% and 12% on MMAct datasets. Through extensive experimentation, we show the robustness of our model on zero shot setting, and limited annotated data setting. We further compare with state-of-the-art methods that use more input modalities and show that our method outperforms significantly on the more difficult MMact dataset, and performs comparably in UTD-MHAD dataset.

研究动机与目标

  • 通过有效融合RGB视频与IMU传感器模态之间的互补信息,提升人体活动识别(HAR)的准确率。
  • 通过多模态学习,解决单模态系统存在的局限性,如视频对遮挡的敏感性以及IMU对身体位置的依赖性。
  • 在数据稀缺和零样本设置下展示鲁棒性能,即在训练过程中排除未见的动作类别。
  • 通过仅使用视频和IMU输入的高效融合,超越使用更复杂或额外模态(如骨骼数据)的最先进方法。

提出的方法

  • 该框架采用两阶段训练流程:首先,分别使用编码器(3D-CNN用于视频,1D-CNN用于IMU)学习模态特定的特征。
  • 视频模态采用S3D 3D-CNN架构进行编码,而IMU数据则通过三个堆叠的1D卷积模块处理,激活函数为ReLU并引入Dropout。
  • 在第二阶段,将两个模态提取的特征进行拼接,并通过两层MLP进行最终的动作分类。
  • 模型采用交叉熵损失进行端到端训练,实现特征学习与融合的联合优化。
  • 该方法避免依赖后处理的骨骼估计,直接使用原始视频和IMU输入。
  • 两阶段设计使各模态编码器可在融合前独立学习强表示,从而提升整体特征质量。

实验结果

研究问题

  • RQ1与单模态基线相比,是否可以通过两阶段多模态学习框架融合RGB视频与IMU数据,显著提升HAR准确率?
  • RQ2在低数据量和零样本设置下(部分动作类别在训练中未见),该方法表现如何?
  • RQ3所提出的融合策略是否优于使用额外模态(如骨骼数据)的最先进方法?
  • RQ4当仅提供25%的训练数据时,模型表现如何?多模态学习是否仍保持优势?
  • RQ5当IMU数据缺乏某些动作类别的覆盖,而视频数据包含这些类别时,视频是否比IMU提供更强的互补信息?

主要发现

  • 所提出的多模态模型在UTD-MHAD数据集上达到96.05%的准确率,相比仅使用视频的基线模型提升22%,相比仅使用IMU的基线模型提升11%。
  • 在MMAct数据集上,模型准确率达到84.05%,相比仅使用视频的设置提升20%,相比仅使用IMU的设置提升12%。
  • 在零样本设置下(训练时隐藏5个动作类别),多模态模型准确率仅下降10%,显著优于单模态设置(下降12–14%)。
  • 当仅使用25%的训练数据时,模型在UTD-MHAD和MMAct上准确率均仅下降10%,表现出对数据稀缺的强鲁棒性。
  • 当IMU数据缺乏某些动作类别的覆盖,但视频数据包含这些类别时,多模态设置(IMU* + RGB)优于(RGB* + IMU),证实视频在缺失模态场景下具有更强的互补性。
  • 尽管仅使用两个模态且避免了如骨骼估计等复杂后处理,该模型仍优于或匹配最先进方法(如VSKD和HAMLET)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。