[论文解读] Unsupervised Statistical Feature-Guided Diffusion Model for Sensor-based Human Activity Recognition
该论文提出了一种无监督的统计特征引导扩散模型(SF-DM),在无需标注数据的情况下生成高质量的合成传感器时间序列数据,用于人体活动识别(HAR)。通过将扩散过程基于均值、标准差、Z得分和偏度等统计特征进行条件控制,SF-DM能够生成多样化且逼真的合成数据,显著提升HAR分类器的性能,优于SMOTE、SVM-SMOTE和TimeGAN等多种基准数据集上的表现。
Human activity recognition (HAR) from on-body sensors is a core functionality in many AI applications: from personal health, through sports and wellness to Industry 4.0. A key problem holding up progress in wearable sensor-based HAR, compared to other ML areas, such as computer vision, is the unavailability of diverse and labeled training data. Particularly, while there are innumerable annotated images available in online repositories, freely available sensor data is sparse and mostly unlabeled. We propose an unsupervised statistical feature-guided diffusion model specifically optimized for wearable sensor-based human activity recognition with devices such as inertial measurement unit (IMU) sensors. The method generates synthetic labeled time-series sensor data without relying on annotated training data. Thereby, it addresses the scarcity and annotation difficulties associated with real-world sensor data. By conditioning the diffusion model on statistical information such as mean, standard deviation, Z-score, and skewness, we generate diverse and representative synthetic sensor data. We conducted experiments on public human activity recognition datasets and compared the method to conventional oversampling and state-of-the-art generative adversarial network methods. Experimental results demonstrate that this can improve the performance of human activity recognition and outperform existing techniques.
研究动机与目标
- 为解决人体活动识别(HAR)中稀缺且标注成本高昂的标注传感器数据问题。
- 开发一种数据生成方法,能够在不依赖类别标签的情况下保留真实传感器时间序列数据的时序与统计特性。
- 通过利用从无标签真实数据生成的合成数据,提升HAR模型的性能。
- 评估统计特征引导条件控制在提升生成传感器数据质量与多样性方面的有效性。
提出的方法
- 该方法采用基于统计特征(如均值、标准差、Z得分和偏度)的扩散模型,这些特征从未标注的传感器时间序列数据中提取。
- 采用两阶段训练框架:首先在大量无标签传感器数据上预训练SF-DM;其次使用少量真实标注数据与合成数据对独立的HAR分类器进行微调。
- 扩散模型采用编码器-解码器架构,通过统计特征嵌入引导去噪过程,以恢复被污染的时间序列数据。
- 统计特征在传感器数据的滑动窗口上计算(例如,MM-FIT、PAMAP2和Opportunity分别为400、200、200个时间点),并在生成过程中作为条件信号使用。
- 模型通过学习逆转一个前向扩散过程来训练,该过程逐步向真实传感器序列添加噪声,从而学习利用统计先验从噪声中重建原始序列。
- 性能通过HAR任务中的准确率和宏平均F1分数进行评估,并与SMOTE、SVM-SMOTE和TimeGAN在相同训练协议下进行比较。
实验结果
研究问题
- RQ1能否在无标注数据的情况下,通过基于统计特征的无监督扩散模型生成提升HAR性能的合成传感器数据?
- RQ2统计特征引导的扩散模型在生成多样化且具有代表性的传感器数据方面,与传统过采样方法和基于GAN的方法相比表现如何?
- RQ3包含统计特征(如偏度、Z得分)在多大程度上提升了生成的合成时间序列数据的质量与实用性?
- RQ4当使用不同数量的真实标注数据进行训练时,SF-DM预训练生成的合成数据对HAR分类器性能的提升效果如何?
主要发现
- 在仅使用20%真实数据的情况下,SF-DM在MM-FIT和Opportunity数据集上将宏平均F1分数相比基线最高提升了5%。
- 在相同数据集上,SF-DM在宏平均F1分数上比TimeGAN高出7%至13%,表明其在泛化能力和数据质量方面具有显著优势。
- 在PAMAP2数据集上,SF-DM的性能与基线相当,且略有超越,未观察到性能下降。
- 消融研究显示,SF-DM[Corresp.P](使用统计特征而非标签作为条件)在低数据场景下始终优于CC-DM(类别条件扩散模型)。
- 当在有限的无标签数据上训练时,SF-DM性能下降,表明稳定训练扩散模型需要充足的训练数据。
- 该方法在处理类别不平衡方面表现出鲁棒性,宏平均F1分数作为评估指标比准确率更可靠,且SF-DM在所有数据集上均持续提升了该指标。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。