[论文解读] Making the Invisible Visible: Action Recognition Through Walls and Occlusions
该论文提出 RF-Action,一种利用无线电频率(RF)信号进行人体动作识别的深度学习模型,通过将3D人体骨骼作为中间表征,实现在墙体遮挡和遮挡情况下的动作识别。通过在共享骨骼空间中联合使用RF和基于视觉的数据集,该模型在可见条件下达到87.8 mAP,在穿墙场景中达到83.0 mAP,优于以往基于RF的系统,并在无遮挡设置下达到与基于视觉的方法相当的性能。
Understanding people's actions and interactions typically depends on seeing them. Automating the process of action recognition from visual data has been the topic of much research in the computer vision community. But what if it is too dark, or if the person is occluded or behind a wall? In this paper, we introduce a neural network model that can detect human actions through walls and occlusions, and in poor lighting conditions. Our model takes radio frequency (RF) signals as input, generates 3D human skeletons as an intermediate representation, and recognizes actions and interactions of multiple people over time. By translating the input to an intermediate skeleton-based representation, our model can learn from both vision-based and RF-based datasets, and allow the two tasks to help each other. We show that our model achieves comparable accuracy to vision-based action recognition systems in visible scenarios, yet continues to work accurately when people are not visible, hence addressing scenarios that are beyond the limit of today's vision-based action recognition.
研究动机与目标
- 在摄像头因遮挡、光照不足或墙体阻挡而失效的情况下,实现人体动作识别。
- 通过使用3D人体骨骼作为共享中间表征,弥合基于视觉与基于RF的动作识别之间的差距。
- 通过引入置信度感知注意力机制和多人动作预测,提升基于RF的动作识别的泛化能力和鲁棒性。
- 证明使用基于视觉的骨骼数据集进行多模态训练可提升在RF数据上的性能。
提出的方法
- 模型以原始RF信号作为输入,通过神经网络生成3D人体骨骼作为中间表征。
- 采用时空自注意力机制,根据关键点的置信度分数对关节进行加权,提升对噪声RF生成骨骼的鲁棒性。
- 多提议模块可同时检测同一场景中不同个体执行的多个动作。
- 模型采用端到端训练,动作识别损失通过骨骼生成网络反向传播,从而提升骨骼生成的准确性。
- 多模态训练将RF数据与基于视觉的骨骼数据集(如PKU-MMD、NTU-RGB+D)结合,提升在不同受试者和环境下的泛化能力。
- 骨骼表征使得骨骼估计与动作识别可联合优化,将关键点定位误差从3.8 cm降低至3.4 cm。
实验结果
研究问题
- RQ1即使在人员被墙体或遮挡物遮挡的情况下,是否可以利用RF信号实现与基于视觉系统性能相当的动作识别?
- RQ2使用3D人体骨骼作为中间表征是否能提升基于RF的动作识别的泛化能力和鲁棒性?
- RQ3置信度感知注意力机制在缓解噪声RF生成骨骼中的误差方面有多有效?
- RQ4多提议模块是否能提升多人同时执行多个动作场景下的性能?
- RQ5使用基于视觉的骨骼数据集进行多模态训练是否能提升在RF数据上的性能?
主要发现
- 在非遮挡条件下,RF-Action在RF-MMD数据集上达到87.8 mAP,与最先进基于视觉的系统性能相当。
- 在穿墙场景中,模型保持强劲性能,mAP达到83.0,展现出对遮挡和信号阻断的鲁棒性。
- 引入注意力模块后,骨骼估计误差从3.8 cm降至3.4 cm,并且与无注意力基线相比,RF-MMD数据集上的mAP提升了7.7个百分点。
- 多提议模块使RF-MMD数据集上的mAP从65.5提升至87.8,显著改善了多人、多动作场景下的性能。
- 使用PKU-MMD进行多模态训练,使RF-MMD数据集上的mAP从83.3提升至87.8,并改善了跨受试者和跨视角划分下的泛化能力。
- 端到端训练相比分别训练骨骼网络与动作网络,将3D骨骼关键点误差降低了0.4 cm,表明中间表征质量得到提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。