QUICK REVIEW
[论文解读] BlazePose: On-device Real-time Body Pose tracking
Valentin Bazarevsky, Ivan Grishchenko|arXiv (Cornell University)|Jun 17, 2020
Human Pose and Action Recognition参考文献 7被引用 86
一句话总结
BlazePose 提供一个轻量级的设备端姿态估计器,输出单人33个关键点,在 Pixel 2 上以超过 30 FPS 运行,使用检测-跟踪管线配合热力图辅助回归结构。
ABSTRACT
We present BlazePose, a lightweight convolutional neural network architecture for human pose estimation that is tailored for real-time inference on mobile devices. During inference, the network produces 33 body keypoints for a single person and runs at over 30 frames per second on a Pixel 2 phone. This makes it particularly suited to real-time use cases like fitness tracking and sign language recognition. Our main contributions include a novel body pose tracking solution and a lightweight body pose estimation neural network that uses both heatmaps and regression to keypoint coordinates.
研究动机与目标
- 在移动设备上实现实时的2D单人姿态估计,保持高帧率。
- 在保持姿态精度的同时,减小模型尺寸和计算量,适用于健身跟踪和手语识别等应用。
- 将热力图监督与轻量级回归编码器结合,允许推理时移除热力图分支。
- 利用快速的设备端面部/躯干检测器来初始化并引导姿态对齐。
- 通过增强和逐点可见性机制处理遮挡和姿态变化。
提出的方法
- 提出一个检测-跟踪管线,其中一个轻量级检测器初始化姿态区域,跟踪网络在每帧预测关键点坐标和存在性。
- 通过借助快速的设备端人脸检测器作为单人场景中人的定位代理,采用以用户为中心的对齐策略。
- 采用来自 BlazeFace、BlazePalm 和 COCO 的33点关节拓扑,以保持与相关模型的一致性。
- 训练一个结合热力图-偏移-回归的网络,其中热力图监督一个轻量级嵌入,但推理阶段仅使用回归到坐标。
- 推理阶段舍弃热力图输出以实现实时性能,同时回归编码器的梯度不回传到热力图特征,从而提高坐标精确度。
- 用姿态先验和遮挡仿真进行数据增强,并包括逐点可见性分类器以处理被遮挡的关节。
实验结果
研究问题
- RQ1一个轻量级的设备端模型是否能够在高帧率下实现带有丰富33点拓扑的单人姿态估计?
- RQ2在推理阶段移除热力图头是否能显著降低计算量而不牺牲精度?
- RQ3由快速人脸检测器初始化的检测-跟踪管线是否能在移动设备上为单人姿态跟踪提供鲁棒的对齐?
- RQ4遮挡和姿态变化如何影响设备端姿态估计,增强和可见性建模是否能减轻这些影响?
- RQ5BlazePose 与 OpenPose 在移动硬件和代表性数据集上的准确性与速度相比如何?
主要发现
- BlazePose 在中等规格的移动CPU(Pixel 2)上实现实时推理(超过30 FPS)。
- 模型输出单人33个身体关键点,在训练阶段结合热力图与回归,推理阶段为了速度丢弃热力图分支。
- 在设备端快速人脸检测器引导下的检测-跟踪管线实现了高效的单人姿态跟踪。
- 与 OpenPose 相比,BlazePose 提供具有竞争力的准确性且在设备端速度显著更快,尤其是在瑜伽/健身姿势上。
- 评估了两种模型变体:BlazePose Full(容量更高)和 BlazePose Lite(更紧凑),BlazePose Full 在健身相关姿势上优于基线 OpenPose,且两种 BlazePose 版本在移动硬件上都提供了显著的速度优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。