[论文解读] Embedded Real-Time Fall Detection Using Deep Learning For Elderly Care
本论文提出了一种基于动态视觉传感器(DVS)数据并针对嵌入式部署进行优化的实时、隐私保护型跌倒检测系统,引入了新型DVS-时间网络(DVS-TN)。该研究构建了DVS跌倒数据集,在仅使用CPU的NVIDIA Jetson TX1上实现了31.25 FPS的处理速度,F1分数达到95.5%,并证明基于DVS的深度学习可在边缘设备上实现高精度、低功耗的跌倒检测。
This paper proposes a real-time embedded fall detection system using a DVS(Dynamic Vision Sensor) that has never been used for traditional fall detection, a dataset for fall detection using that, and a DVS-TN(DVS-Temporal Network). The first contribution is building a DVS Falls Dataset, which made our network to recognize a much greater variety of falls than the existing datasets that existed before and solved privacy issues using the DVS. Secondly, we introduce the DVS-TN : optimized deep learning network to detect falls using DVS. Finally, we implemented a fall detection system which can run on low-computing H/W with real-time, and tested on DVS Falls Dataset that takes into account various falls situations. Our approach achieved 95.5% on the F1-score and operates at 31.25 FPS on NVIDIA Jetson TX1 board.
研究动机与目标
- 通过使用动态视觉传感器(DVS)替代传统RGB摄像头,解决老年人跌倒检测中的隐私问题。
- 开发一种适用于计算资源有限的嵌入式硬件的实时、低功耗跌倒检测系统。
- 构建一个全新的、全面的DVS跌倒数据集,包含多样化的跌倒与非跌倒动作,以提升模型泛化能力。
- 优化深度学习模型(DVS-TN),实现在仅支持CPU的嵌入式平台上高精度与低推理延迟。
提出的方法
- 从31名受试者采集1,860段视频片段,构建DVS跌倒数据集,涵盖前、后、左、右四个方向的跌倒、躺下、坐下、站立、行走及假性跌倒等动作。
- 采用DVS图像作为输入,其表示亮度的时序变化,相较于RGB视频,天然具备更低的隐私风险。
- 基于TSN(时间片段网络)设计DVS-TN模型,但针对DVS输入进行适配:将50帧DVS片段堆叠,并采用时空卷积神经网络。
- 应用模型压缩技术:输入尺寸下采样至32×32,使用区域间插值以保留特征,采用深度可分离卷积,并合并批量归一化层以降低推理开销。
- 针对仅使用CPU的NVIDIA Jetson TX1平台进行网络优化,实现31.25 FPS的实时性能。
- 通过对比双线性插值与区域插值,选择在低分辨率下最小化特征损失的最优方法。
实验结果
研究问题
- RQ1基于DVS的系统是否能在保护用户隐私的同时实现高精度的实时跌倒检测?
- RQ2在嵌入式系统上应用于跌倒检测时,自定义的DVS-TN模型相较于现有动作识别模型效果如何?
- RQ3哪些模型压缩与优化技术可实现在仅使用CPU的嵌入式平台上以31.25 FPS实现高精度跌倒检测?
- RQ4包含多样化跌倒场景的基于DVS的数据集是否相比现有基于RGB的数据集能提升模型鲁棒性?
主要发现
- DVS-TN模型在DVS跌倒数据集上实现了95.5%的F1分数,证明了其高检测精度。
- 系统在仅使用CPU的NVIDIA Jetson TX1上以31.25 FPS运行,实现了在低功耗硬件上的实时处理。
- 模型优化将推理操作数从23亿降低至1140万,采用深度可分离卷积实现1.54倍加速,通过批量归一化层合并实现1.75倍加速。
- 在32×32输入尺寸下,区域间插值比双线性插值更好地保持了特征完整性,维持了高精度。
- 在CPU上部署时,DVS-TN模型在速度与F1分数上均优于SOTA模型如TSN与SqueezeNet。
- 包含558段跌倒视频片段及多样化动作类型的DVS跌倒数据集,使模型在不同跌倒动力学与视角下均具备强泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。