[论文解读] Person-in-WiFi: Fine-grained Person Perception using WiFi
该论文提出 Person-in-WiFi,这是首个仅使用现成的 WiFi 天线作为一维传感器,实现细粒度人体感知(包括身体分割与姿态估计)的系统。通过在多组 WiFi 收发器对获取的 1D 信道状态信息(CSI)信号上应用深度学习,并以 2D 图像标注为监督信号,其性能可与基于摄像头的方法相媲美,证明了一维电磁波信号尽管存在严重不适定性,仍可重建出详细的人体空间结构。
Fine-grained person perception such as body segmentation and pose estimation has been achieved with many 2D and 3D sensors such as RGB/depth cameras, radars (e.g., RF-Pose) and LiDARs. These sensors capture 2D pixels or 3D point clouds of person bodies with high spatial resolution, such that the existing Convolutional Neural Networks can be directly applied for perception. In this paper, we take one step forward to show that fine-grained person perception is possible even with 1D sensors: WiFi antennas. To our knowledge, this is the first work to perceive persons with pervasive WiFi devices, which is cheaper and power efficient than radars and LiDARs, invariant to illumination, and has little privacy concern comparing to cameras. We used two sets of off-the-shelf WiFi antennas to acquire signals, i.e., one transmitter set and one receiver set. Each set contains three antennas lined-up as a regular household WiFi router. The WiFi signal generated by a transmitter antenna, penetrates through and reflects on human bodies, furniture and walls, and then superposes at a receiver antenna as a 1D signal sample (instead of 2D pixels or 3D point clouds). We developed a deep learning approach that uses annotations on 2D images, takes the received 1D WiFi signals as inputs, and performs body segmentation and pose estimation in an end-to-end manner. Experimental results on over 100000 frames under 16 indoor scenes demonstrate that Person-in-WiFi achieved person perception comparable to approaches using 2D images.
研究动机与目标
- 仅使用现成的 WiFi 天线,实现细粒度的人体感知(如身体分割与姿态估计),其成本更低、功耗更小,且比摄像头、雷达或 LiDAR 更具隐私保护性。
- 解决从一维 WiFi 信道状态信息(CSI)信号中重建人体二维空间细节的挑战,这些信号由于多径传播、人体异质性以及生理运动而本质上具有歧义性。
- 开发一种深度学习框架,利用来自 2D RGB 视频的标注信息,将一维 CSI 信号映射为二维人体掩码与关节点坐标,实现端到端训练。
- 在真实室内环境中评估基于 WiFi 的感知可行性与性能,包括对未训练场景的泛化能力。
- 探索数据增强与对抗性训练技术,以提升对环境变化的鲁棒性,并改善在未见场景中的泛化能力。
提出的方法
- 系统使用两组各三个现成的 WiFi 天线(一个发射器,一个接收器),排列方式类似标准路由器,以捕获中心频率为 2.4 GHz 的 30 个频率上的 1D CSI 信号。
- 每条 CSI 信号是人体、家具和墙壁反射波的叠加,形成每对天线的 1D 时间序列信号。
- 使用 2D 图像标注(来自 OpenPose 和 Mask R-CNN 的人体掩码与关节点坐标)作为监督信号,以一维 CSI 信号为输入,端到端训练深度学习模型。
- 模型采用基于 U-Net 的架构进行分割,使用热力图回归头进行关键点估计,联合优化两项任务。
- 为提升对环境变化的鲁棒性,作者引入一种基于 GAN 的对抗性训练策略,其中生成网络学习生成环境无关的 CSI 表示。
- 系统在 16 个室内场景中超过 100,000 帧的数据上进行评估,性能通过 mIoU 和 mPCK 指标与基于摄像头的基线方法进行比较。
实验结果
研究问题
- RQ1尽管从一维幅度数据中重建二维空间结构存在严重不适定性,是否能仅使用一维 WiFi 信号实现细粒度的人体感知(包括分割与姿态估计)?
- RQ2在分割准确率与姿态估计精度方面,基于 WiFi 的人体感知性能与基于摄像头的最先进方法相比如何?
- RQ3在 2D 图像标注上训练的深度学习模型在多大程度上能泛化到一维 WiFi CSI 信号?其主要失败模式是什么?
- RQ4对抗性训练与数据增强能否提升模型在布局与材质不同的未见室内环境中的泛化能力?
- RQ5基于 WiFi 的感知的主要局限性是什么,特别是在小肢体、罕见姿态与遮挡方面?这些局限性如何缓解?
主要发现
- Person-in-WiFi 在身体分割任务上实现了 0.66 的平均交并比(mIoU),在姿态估计任务上实现了 78.75% 的 mPCK@0.20,性能与基于摄像头的方法相当。
- 在 160 个均匀采样的测试帧上,系统实现了 mIoU 为 0.66 和 mPCK@0.20 为 78.75%,表明其对多样化室内场景具有强大的泛化能力。
- 针对环境不变性的对抗性训练将未训练环境中的 mIoU 从 0.12 提升至 0.24,mPCK@0.20 从 19.34% 提升至 31.06%,显示出在真实场景部署中的潜力。
- 失败案例主要源于空间分辨率较低(例如,12.5 cm 波长下因衍射导致小肢体缺失)、罕见姿态以及单摄像头视场限制导致的标注不完整。
- 模型在较大身体部位(如躯干和手臂)上的表现优于小或被遮挡的部位(如头部和脚部),头部与脚部组的关节点 PCK 分数较低。
- 结果表明,若能获取更多高质量数据并改进数据增强方法,基于 WiFi 的感知与基于摄像头的感知之间的性能差距可进一步缩小。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。