[论文解读] Multi-Stage Based Feature Fusion of Multi-Modal Data for Human Activity Recognition
该论文提出了一种两阶段多模态框架,通过融合RGB视频和IMU传感器数据进行人体活动识别,采用3D-CNN和1D-CNN编码器,随后进行特征融合与分类。在UTD-MHAD数据集上达到96.05%的准确率,在MMAct数据集上达到84.05%,分别比单模态基线模型高出22%和11%,并在低数据量和零样本设置下表现出强鲁棒性。
To properly assist humans in their needs, human activity recognition (HAR) systems need the ability to fuse information from multiple modalities. Our hypothesis is that multimodal sensors, visual and non-visual tend to provide complementary information, addressing the limitations of other modalities. In this work, we propose a multi-modal framework that learns to effectively combine features from RGB Video and IMU sensors, and show its robustness for MMAct and UTD-MHAD datasets. Our model is trained in two-stage, where in the first stage, each input encoder learns to effectively extract features, and in the second stage, learns to combine these individual features. We show significant improvements of 22% and 11% compared to video only and IMU only setup on UTD-MHAD dataset, and 20% and 12% on MMAct datasets. Through extensive experimentation, we show the robustness of our model on zero shot setting, and limited annotated data setting. We further compare with state-of-the-art methods that use more input modalities and show that our method outperforms significantly on the more difficult MMact dataset, and performs comparably in UTD-MHAD dataset.
研究动机与目标
- 通过有效融合RGB视频与IMU传感器模态之间的互补信息,提升人体活动识别(HAR)的准确率。
- 通过多模态学习,解决单模态系统存在的局限性,如视频对遮挡的敏感性以及IMU对身体位置的依赖性。
- 在数据稀缺和零样本设置下展示鲁棒性能,即在训练过程中排除未见的动作类别。
- 通过仅使用视频和IMU输入的高效融合,超越使用更复杂或额外模态(如骨骼数据)的最先进方法。
提出的方法
- 该框架采用两阶段训练流程:首先,分别使用编码器(3D-CNN用于视频,1D-CNN用于IMU)学习模态特定的特征。
- 视频模态采用S3D 3D-CNN架构进行编码,而IMU数据则通过三个堆叠的1D卷积模块处理,激活函数为ReLU并引入Dropout。
- 在第二阶段,将两个模态提取的特征进行拼接,并通过两层MLP进行最终的动作分类。
- 模型采用交叉熵损失进行端到端训练,实现特征学习与融合的联合优化。
- 该方法避免依赖后处理的骨骼估计,直接使用原始视频和IMU输入。
- 两阶段设计使各模态编码器可在融合前独立学习强表示,从而提升整体特征质量。
实验结果
研究问题
- RQ1与单模态基线相比,是否可以通过两阶段多模态学习框架融合RGB视频与IMU数据,显著提升HAR准确率?
- RQ2在低数据量和零样本设置下(部分动作类别在训练中未见),该方法表现如何?
- RQ3所提出的融合策略是否优于使用额外模态(如骨骼数据)的最先进方法?
- RQ4当仅提供25%的训练数据时,模型表现如何?多模态学习是否仍保持优势?
- RQ5当IMU数据缺乏某些动作类别的覆盖,而视频数据包含这些类别时,视频是否比IMU提供更强的互补信息?
主要发现
- 所提出的多模态模型在UTD-MHAD数据集上达到96.05%的准确率,相比仅使用视频的基线模型提升22%,相比仅使用IMU的基线模型提升11%。
- 在MMAct数据集上,模型准确率达到84.05%,相比仅使用视频的设置提升20%,相比仅使用IMU的设置提升12%。
- 在零样本设置下(训练时隐藏5个动作类别),多模态模型准确率仅下降10%,显著优于单模态设置(下降12–14%)。
- 当仅使用25%的训练数据时,模型在UTD-MHAD和MMAct上准确率均仅下降10%,表现出对数据稀缺的强鲁棒性。
- 当IMU数据缺乏某些动作类别的覆盖,但视频数据包含这些类别时,多模态设置(IMU* + RGB)优于(RGB* + IMU),证实视频在缺失模态场景下具有更强的互补性。
- 尽管仅使用两个模态且避免了如骨骼估计等复杂后处理,该模型仍优于或匹配最先进方法(如VSKD和HAMLET)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。