[论文解读] Temporal Unet: Sample Level Human Action Recognition using WiFi
本文提出Temporal Unet,一种新颖的深度学习模型,用于利用WiFi信道状态信息(CSI)进行样本级人体动作识别。通过结合时间卷积与转置卷积层及跳跃连接,该模型能够以高精度将单个CSI样本分类至动作类别,其在基准数据集上的动作检测平均AP达到0.98,动作分类平均AP达到0.86,优于以往的序列级方法。
Human doing actions will result in WiFi distortion, which is widely explored for action recognition, such as the elderly fallen detection, hand sign language recognition, and keystroke estimation. As our best survey, past work recognizes human action by categorizing one complete distortion series into one action, which we term as series-level action recognition. In this paper, we introduce a much more fine-grained and challenging action recognition task into WiFi sensing domain, i.e., sample-level action recognition. In this task, every WiFi distortion sample in the whole series should be categorized into one action, which is a critical technique in precise action localization, continuous action segmentation, and real-time action recognition. To achieve WiFi-based sample-level action recognition, we fully analyze approaches in image-based semantic segmentation as well as in video-based frame-level action recognition, then propose a simple yet efficient deep convolutional neural network, i.e., Temporal Unet. Experimental results show that Temporal Unet achieves this novel task well. Codes have been made publicly available at https://github.com/geekfeiw/WiSLAR.
研究动机与目标
- 为解决WiFi感知中缺乏细粒度的样本级动作识别问题,超越传统的序列级分类方法。
- 通过为每个单独的CSI样本标注动作类别,实现实时且精确的时间定位与动作识别。
- 开发一种统一的深度学习框架,有效处理样本级动作检测与分类任务。
- 克服在建模时间上下文以及从噪声中区分细微动作转换方面的挑战。
提出的方法
- 提出Temporal Unet,一种受U-Net启发的架构,沿CSI序列的时间轴应用时间卷积、池化和转置卷积层。
- 使用堆叠的时间层捕捉来自邻近样本的多尺度上下文信息,实现在时间维度上的鲁棒特征学习。
- 在编码器与解码器模块之间引入跳跃连接,以保留时空细节并改善梯度流动。
- 应用时间最大池化和步长大于1的卷积操作,实现特征的下采样与上采样,同时保持时间分辨率。
- 采用端到端训练方式,使用交叉熵损失进行分类,采用改进的AP损失进行检测,实现两个任务的联合优化。
- 以3个OFDM子载波的CSI数据作为输入,处理由人体动作引起的原始时序畸变。
实验结果
研究问题
- RQ1仅使用原始WiFi CSI时序数据,深度学习模型能否实现准确的样本级动作识别?
- RQ2如何有效建模邻近样本的时间上下文信息,以提升单个CSI样本的分类性能?
- RQ3单一统一架构能否在高性能下同时完成样本级动作检测与分类?
- RQ4跳跃连接与多尺度时间卷积对细粒度动作识别准确率有何影响?
- RQ5与现有序列级方法相比,该方法在时间精度与实时适用性方面表现如何?
主要发现
- Temporal Unet在样本级动作检测中实现0.98的平均AP,表明即使在高成功阈值下仍具有优异性能。
- 在样本级动作分类中,模型实现0.86的平均AP,对大多数动作类别的区分具有高度置信度。
- 混淆矩阵显示,主要误分类发生在“右手”与“左手”之间,可能由于对称性所致。
- 从“非动作”状态到“动作”状态的过渡阶段是检测与分类任务中错误的最常见来源。
- 可视化结果证实,模型能准确识别动作的起始与结束时间,置信度曲线与人工标注高度吻合。
- 该模型通过实现逐样本标注,优于以往的序列级方法,对实时与连续动作分割至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。