[论文解读] SSHFD: Single Shot Human Fall Detection with Occluded Joints Resilience
SSHFD 是一种单帧深度学习框架,用于从单张 RGB 图像中检测人体跌倒,其利用对外观和视角不变的基于姿态的表征,并采用遮挡关节鲁棒性(Occluded Joints Resilience, OJR)模块,在部分遮挡情况下仍能保持高精度。该方法通过将纯合成数据中的知识迁移至真实世界未见环境,实现了最先进的泛化性能,对缺失关节具有高度鲁棒性。
Falling can have fatal consequences for elderly people especially if the fallen person is unable to call for help due to loss of consciousness or any injury. Automatic fall detection systems can assist through prompt fall alarms and by minimizing the fear of falling when living independently at home. Existing vision-based fall detection systems lack generalization to unseen environments due to challenges such as variations in physical appearances, different camera viewpoints, occlusions, and background clutter. In this paper, we explore ways to overcome the above challenges and present Single Shot Human Fall Detector (SSHFD), a deep learning based framework for automatic fall detection from a single image. This is achieved through two key innovations. First, we present a human pose based fall representation which is invariant to appearance characteristics. Second, we present neural network models for 3d pose estimation and fall recognition which are resilient to missing joints due to occluded body parts. Experiments on public fall datasets show that our framework successfully transfers knowledge of 3d pose estimation and fall recognition learnt purely from synthetic data to unseen real-world data, showcasing its generalization capability for accurate fall detection in real-world scenarios.
研究动机与目标
- 为解决基于视觉的跌倒检测系统在真实世界未见环境中因外观、视角、遮挡和背景杂乱等因素导致的泛化能力不足问题。
- 开发一种仅依赖单张图像运行的跌倒检测框架,避免对多帧序列或可穿戴传感器的依赖。
- 构建一种对物理外观、光照和空间位置不变的基于姿态的跌倒表征,以增强跨环境的可迁移性。
- 设计用于 3D 姿态估计和跌倒识别的神经网络,使其在关节缺失或遮挡的情况下仍能保持高精度。
- 证明从纯合成数据到真实世界公开数据集的零样本迁移在跌倒检测任务中的成功性,且无需真实世界微调。
提出的方法
- 该框架使用堆叠沙漏网络从单张 RGB 图像中预测 2D 人体姿态,生成人体提议作为输入。
- 一个 3D 姿态估计网络将 2D 姿态预测结果转换为 3D 关节坐标,采用一种新颖的遮挡关节鲁棒性(Occluded Joints Resilience, OJR)模块以处理缺失关节。
- OJR 模块通过集成注意力机制和可学习残差连接,实现对缺失关节位置的重建并保持特征完整性。
- 跌倒识别由一个融合网络完成,该网络结合 2D 和 3D 姿态表征,实现在姿态模糊和遮挡情况下的鲁棒分类。
- 整个流水线仅在合成数据上进行训练,通过领域随机化和数据增强技术模拟真实世界多样性。
- 该框架采用双分支架构进行关节表征:一个用于图像空间中的 2D 姿态,另一个用于笛卡尔空间中的 3D 姿态,两者均针对外观和视角不变性进行优化。
实验结果
研究问题
- RQ1单帧跌倒检测系统是否能在无需真实世界训练数据的情况下泛化至未见的真实世界环境?
- RQ2基于姿态的跌倒表征在实现对外观、光照和视角变化的不变性方面效果如何?
- RQ3在关节遮挡情况下,从合成数据训练的神经网络在真实世界场景中识别跌倒的能力有多强?
- RQ4与标准模型相比,所提出的遮挡关节鲁棒性(Occluded Joints Resilience, OJR)模块在缺失关节输入条件下对性能的提升程度如何?
- RQ5在真实世界设置中,从合成数据训练的 3D 姿态估计网络能否从不完整的 2D 姿态输入中恢复出准确的 3D 关节位置?
主要发现
- 在 MultiCam 数据集上,OJR 模型在 8 个关节缺失的情况下,F1 分数相比非 OJR 模型最高提升了 35%。
- 在 Le2i 跌倒数据集上,OJR 模型在相同 8 个关节缺失条件下,F1 分数提升了 40%。
- 采用 OJR 的 3D PoseNet 在 7 个关节缺失时,平均姿态误差从 464.16 mm(无 OJR)降低至 34.21 mm,展现出强大的恢复能力。
- 该框架即使仅在合成数据上训练,也能在真实世界数据集上实现高跌倒识别准确率,证明了其强大的零样本泛化能力。
- 定性结果表明,OJR 支持的模型即使在严重遮挡情况下仍能正确分类跌倒事件,而基线模型在类似条件下则失败。
- 所提出的 2D 和 3D 基于姿态的表征在跌倒识别任务中优于基于骨骼的视觉表征,尤其在噪声或不完整输入数据条件下表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。