[论文解读] Activity2Vec: Learning ADL Embeddings from Sensor Data with a Sequence-to-Sequence Model
该论文提出 Activity2Vec,一种基于序列到序列 RNN 的模型,能够从原始传感器数据中学习通用的、低维嵌入表示,用于智能家居和可穿戴设备中的活动识别。通过采用带有 LSTM 的编码器-解码器架构,该模型捕捉了时间依赖性,并生成紧凑且语义有意义的特征,在分类和聚类任务中优于手工设计的特征和原始数据。
Recognizing activities of daily living (ADLs) plays an essential role in analyzing human health and behavior. The widespread availability of sensors implanted in homes, smartphones, and smart watches have engendered collection of big datasets that reflect human behavior. To obtain a machine learning model based on these data,researchers have developed multiple feature extraction methods. In this study, we investigate a method for automatically extracting universal and meaningful features that are applicable across similar time series-based learning tasks such as activity recognition and fall detection. We propose creating a sequence-to-sequence (seq2seq) model to perform this feature learning. Beside avoiding feature engineering, the meaningful features learned by the seq2seq model can also be utilized for semi-supervised learning. We evaluate both of these benefits on datasets collected from wearable and ambient sensors.
研究动机与目标
- 为解决手工设计特征在活动识别中的局限性,这些特征需要专家知识且缺乏泛化能力。
- 克服传统自编码器在处理 ADL 数据中时间依赖性和可变长度时间序列输入方面的不足。
- 开发一种自监督特征学习框架,从原始传感器序列中提取有意义且紧凑的表示,而无需为特征提取提供标注数据。
- 通过零样本推理评估模型对未见活动类别的泛化能力。
- 通过真实世界传感器数据集上的类内相似性和聚类性能评估所学嵌入的质量。
提出的方法
- 采用带有双向 LSTM 的序列到序列(seq2seq)模型作为编码器,使用分层解码器处理原始传感器时间序列。
- 使用重建损失端到端训练模型,从学习到的潜在表示中重建输入序列,从而实现无监督特征学习。
- 将学习到的编码器的最终隐藏状态作为固定长度的嵌入向量(activity2vec)用于下游分类任务。
- 应用 t-SNE 可视化,比较所学表示空间中 activity2vec 嵌入与手工设计特征的聚类质量。
- 在两个数据集上评估模型:HAR(可穿戴传感器)和 HH101(环境型智能家庭传感器),使用 F1 分数和类内相似性指标。
- 进行留一类别排除实验,通过使用在其余所有类别上训练的模型编码未见类别,以测试零样本泛化能力。
实验结果
研究问题
- RQ1序列到序列模型能否从原始传感器数据中学习到跨不同 ADL 识别任务的通用且有意义的嵌入表示?
- RQ2所提出的 activity2vec 框架在可穿戴和环境传感器数据集上的活动识别准确率是否优于手工设计特征和原始数据?
- RQ3所学嵌入是否能捕捉足够的语义结构,使相同类别的活动在潜在空间中聚类更紧密,如类内相似性所示?
- RQ4在不重新训练的情况下,模型在仅使用相关类别编码表示的情况下,能在多大程度上泛化到未见的活动类别?
- RQ5所学嵌入是否保留了传感器时间序列数据中固有的时间依赖性和空间关系?
主要发现
- 在 HAR 测试集上,Activity2Vec 达到了最高的 F1 分数(步行:0.97,上楼:0.95,下楼:0.94),优于原始特征和手工设计特征。
- activity2vec 嵌入的类内相似性显著更低(例如,站立类为 1.15),相比手工设计特征(11.90),表明同类别实例的聚类更紧密。
- 在留一类别排除评估中,随机森林模型对所有被排除类别的 F1 分数均超过 0.92,证明了使用预训练的 activity2vec 特征可实现有效的零样本泛化。
- t-SNE 可视化证实,activity2vec 嵌入在每个活动类别上形成分离良好且几何一致的聚类,相似活动(如上下楼)在空间中彼此靠近。
- 在 HH101 数据集上,activity2vec 维持了具有竞争力的性能(如:洗澡 F1: 0.83,卫生 F1: 0.87,放松 F1: 0.93),且类内相似性更低(如:洗澡类为 1.34),低于手工设计特征(0.97),表明聚类效果更优。
- 该模型在无需监督或任务特定微调的情况下学习有意义表示的能力,凸显其在健康监测应用中用于半监督和少样本学习的潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。