Skip to main content
QUICK REVIEW

[论文解读] Interpretable Parallel Recurrent Neural Networks with Convolutional Attentions for Multi-Modality Activity Modeling

Kaixuan Chen, Lina Yao|arXiv (Cornell University)|May 17, 2018
Context-Aware Activity Recognition Systems参考文献 19被引用 8
一句话总结

本文提出了一种可解释的并行循环神经网络,结合卷积注意力机制,用于可穿戴传感器的多模态人体活动识别。通过将三轴传感器数据转换为活动帧,并应用基于注意力的特征选择,该模型在提升识别准确率的同时,突出显示关键身体部位和传感器模态,实现了最先进的性能,同时增强了可解释性并降低了计算成本。

ABSTRACT

Multimodal features play a key role in wearable sensor-based human activity recognition (HAR). Selecting the most salient features adaptively is a promising way to maximize the effectiveness of multimodal sensor data. In this regard, we propose a "collect fully and select wisely" principle as well as an interpretable parallel recurrent model with convolutional attentions to improve the recognition performance. We first collect modality features and the relations between each pair of features to generate activity frames, and then introduce an attention mechanism to select the most prominent regions from activity frames precisely. The selected frames not only maximize the utilization of valid features but also reduce the number of features to be computed effectively. We further analyze the accuracy and interpretability of the proposed model based on extensive experiments. The results show that our model achieves competitive performance on two benchmarked datasets and works well in real life scenarios.

研究动机与目标

  • 为解决现有HAR模型在处理可穿戴传感器数据中个体间差异性和类别间相似性方面的局限性。
  • 通过充分捕捉不同身体部位间多模态传感器信号(加速度、角速度、磁场)的成对关系,改进特征表示。
  • 开发一种既准确又可解释的深度学习模型,以揭示哪些传感器和身体部位对活动分类贡献最大。
  • 通过注意力机制仅聚焦于传感器数据中的显著区域,避免处理全部数据,从而降低计算成本。

提出的方法

  • 将三轴可穿戴传感器数据(加速度计、陀螺仪、磁力计)转换为活动帧,以编码所有传感器信号与模态之间的成对关系。
  • 构建一个包含两条分支的并行循环架构:一条使用基于注意力的LSTM,聚焦于活动帧中的显著片段;另一条使用标准LSTM处理完整帧。
  • 采用卷积注意力机制,在每个时间步动态从活动帧中选择小型、信息丰富的区域(片段),由一个片段网络引导。
  • 使用蒙特卡洛采样,通过多个片段副本的采样来稳定训练,并提升基于注意力的特征选择的鲁棒性。
  • 通过拼接两个LSTM分支的输出并进行分类,生成最终的活动预测结果。
  • 应用可学习的片段网络,预测下一个最具信息量的区域位置,从而实现在时间上对注意力的迭代优化。

实验结果

研究问题

  • RQ1将可穿戴传感器数据新颖地表示为活动帧,是否能比传统方法更好地捕捉传感器间与模态间的关系?
  • RQ2基于注意力的循环模型在识别区分跑步、步行和仰卧等活动时,是否能有效识别出最显著的传感器模态和身体部位?
  • RQ3与全数据处理基线相比,所提出的模型在保持或提升识别准确率的同时,能在多大程度上降低计算成本?
  • RQ4注意力机制在识别对活动分类贡献最大的传感器和身体部位方面是否具备可解释性?其结果是否与生理学直觉一致?

主要发现

  • 所提出的模型在MHEALTH、PAMAP2和MARS基准数据集上实现了最先进的性能,准确率超越了现有SOTA方法。
  • 在跑步任务中,模型识别出脚踝加速度为最显著的模态(占片段的30.55%),其次是心电图(ECG)和脚踝角速度,与生理学预期一致。
  • 注意力机制有效突出腿部和脚踝为主要贡献区域,同时最小化对上肢的关注,证实了现实世界的合理性。
  • 通过仅聚焦于信息丰富的片段而非每一步处理全部输入,该模型在降低计算负载的同时仍保持高准确率。
  • 超参数分析表明,片段窗口宽度与高度的固定比例4:1可实现最佳性能,且在不同数据集上均表现稳定。
  • 该模型对超参数变化具有鲁棒性,准确率在特定片段数量和蒙特卡洛采样副本数下达到峰值,表明其具备强大的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。