[论文解读] Attend And Discriminate: Beyond the State-of-the-Art for Human Activity Recognition using Wearable Sensors
本文提出了一种新颖的基于可穿戴传感器的人体活动识别深度学习框架,通过跨通道注意力、中心损失正则化以及数据无关的混合增强,提升了特征表示能力。该方法在四个多样化的基准上实现了新的最先进性能,通过显式建模传感器模态间的相互作用,提升了特征紧凑性和泛化能力,准确率最高提升了6%。
Wearables are fundamental to improving our understanding of human activities, especially for an increasing number of healthcare applications from rehabilitation to fine-grained gait analysis. Although our collective know-how to solve Human Activity Recognition (HAR) problems with wearables has progressed immensely with end-to-end deep learning paradigms, several fundamental opportunities remain overlooked. We rigorously explore these new opportunities to learn enriched and highly discriminating activity representations. We propose: i) learning to exploit the latent relationships between multi-channel sensor modalities and specific activities; ii) investigating the effectiveness of data-agnostic augmentation for multi-modal sensor data streams to regularize deep HAR models; and iii) incorporating a classification loss criterion to encourage minimal intra-class representation differences whilst maximising inter-class differences to achieve more discriminative features. Our contributions achieves new state-of-the-art performance on four diverse activity recognition problem benchmarks with large margins -- with up to 6% relative margin improvement. We extensively validate the contributions from our design concepts through extensive experiments, including activity misalignment measures, ablation studies and insights shared through both quantitative and qualitative studies.
研究动机与目标
- 解决多通道可穿戴传感器模态与特定人体活动之间潜在关系建模的未充分探索潜力。
- 通过将数据无关的混合增强应用于多模态传感器时间序列数据,提升HAR的泛化能力,尽管该方法在计算机视觉中已取得成功,但在HAR中仍被低估。
- 通过引入中心损失作为互补优化目标,减少类内可变性并增强类间可分性,从而提升学习表征的判别能力。
- 开发一个统一且可泛化的框架,在多种可穿戴HAR基准上超越现有最先进模型。
提出的方法
- 提出一种跨通道交互编码器(CIE),利用自注意力机制建模79个传感器通道之间的潜在相关性,生成更丰富的特征图,以提升表征学习能力。
- 采用注意力GRU编码器(AGE),动态加权时间步长,聚焦于短序列(T=8)中最具信息量的隐藏状态,尤其是最终状态。
- 将中心损失作为正则化项,以最小化类内特征方差并最大化类间边距,从而增强判别能力。
- 通过样本对之间的线性插值,将混合增强应用于多通道时间序列数据,无需模态特定设计,提升训练数据多样性。
- 在端到端深度学习流程中整合CIE、AGE、中心损失和混合增强,联合优化表征质量与泛化能力。
- 在四个多样化的HAR基准上采用统一评估协议,验证框架的鲁棒性与泛化能力。
实验结果
研究问题
- RQ1通过自注意力机制建模跨通道传感器交互是否能提升基于可穿戴设备的HAR中的表征学习?
- RQ2将中心损失作为损失准则是否能生成更紧凑且更具判别性的HAR特征表征?
- RQ3数据无关的混合增强是否能有效正则化在小规模、多模态传感器数据集上训练的深度HAR模型?
- RQ4在统一框架中,各个组件(CIE、AGE、中心损失、混合增强)对性能提升的贡献如何?
- RQ5所提出的框架在多种可穿戴传感器HAR基准上的泛化能力达到何种程度?
主要发现
- 所提框架在四个多样化的HAR基准上实现了新的最先进性能,相比先前SOTA方法最高实现6%的相对准确率提升。
- 仅使用混合增强,就在Opportunity数据集上将准确率提升了5.2%(从67.2%提升至70.7%),证明其在增强多模态传感器序列方面的有效性。
- 混合增强与中心损失的结合带来了最高的性能增益,表明对紧凑性与可分性的联合优化极为有效。
- 具有自注意力机制的跨通道交互编码器(CIE)带来的性能增益大于注意力GRU(AGE),尤其是在短序列中,因其能有效建模传感器间依赖关系。
- 学习到的注意力分数可视化揭示了有意义且可解释的模式——例如,在饮水任务中对右臂IMU表现出强注意力,在弯腰动作中则对背部和左臂IMU有显著关注,验证了模型的可解释性。
- 消融实验确认,每个组件(CIE、AGE、中心损失、混合增强)均对性能有显著贡献,其中CIE和中心损失的个体提升最为显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。