[论文解读] Skeleton Boxes: Solving skeleton based action detection with a single deep convolutional neural network
本文提出Skeleton Boxes,一种新颖的端到端深度卷积神经网络,用于基于骨架的动作检测。该方法将3D骨架序列映射为平移不变和尺度不变的彩色图像,随后应用改进的SSD框架实现精确且高效的检测。在PKU-MMD数据集上,该方法取得了最先进性能,跨视角评估的mAP达到0.945,跨被试评估的mAP达到0.613,显著优于先前方法。
Action recognition from well-segmented 3D skeleton video has been intensively studied. However, due to the difficulty in representing the 3D skeleton video and the lack of training data, action detection from streaming 3D skeleton video still lags far behind its recognition counterpart and image based object detection. In this paper, we propose a novel approach for this problem, which leverages both effective skeleton video encoding and deep regression based object detection from images. Our framework consists of two parts: skeleton-based video image mapping, which encodes a skeleton video to a color image in a temporal preserving way, and an end-to-end trainable fast skeleton action detector (Skeleton Boxes) based on image detection. Experimental results on the latest and largest PKU-MMD benchmark dataset demonstrate that our method outperforms the state-of-the-art methods with a large margin. We believe our idea would inspire and benefit future research in this important area.
研究动机与目标
- 解决在流式3D骨架视频中缺乏有效、端到端深度学习框架用于基于骨架的动作检测的问题。
- 克服3D骨架数据表示的挑战以及检测任务中训练数据稀缺的问题。
- 通过将SSD框架适配于骨架映射图像,弥合基于图像的目标检测与基于骨架的动作检测之间的差距。
- 开发一种平移和尺度不变的图像映射方法,以保留骨架的时间与空间运动特性。
- 在无需滑动窗口或区域建议的情况下,实现高检测精度与计算效率。
提出的方法
- 通过将关节点的x、y、z坐标分别映射到R、G、B通道,将3D骨架序列转换为彩色图像,同时保留时间顺序。
- 应用平移和尺度不变的归一化方法:$ p^{jk} = \text{floor}\left(255 \cdot \frac{c^{jk} - c^{jk}_{\text{min}}}{\max_k(c^{jk}_{\text{max}} - c^{jk}_{\text{min}})} \right) $,其中归一化按序列进行,而非在整个数据集上进行。
- 将SSD目标检测框架适配于骨架映射图像,通过使用具有不同宽高比的默认框(aspect ratios $ \frac{1}{7}, \frac{1}{5}, \frac{1}{3}, \frac{1}{2}, 1, 2, 3, 5, 7 $)来检测动作实例,以应对高宽高比的动作片段。
- 使用多尺度特征图,在不同尺度和宽高比的默认框上检测持续时间与空间范围各异的动作。
- 采用联合损失函数进行网络训练:$ L(x,c,l,g) = \frac{1}{N}(L_{\text{conf}}(x,c) + \alpha L_{\text{loc}}(x,l,g)) $,其中定位损失使用平滑L1,分类损失使用Softmax。
- 在训练过程中应用困难负样本挖掘(负样本与正样本比例为3:1)和随机图像块采样进行数据增强。
实验结果
研究问题
- RQ1是否可以有效训练单一深度卷积神经网络,实现无需区域建议或滑动窗口的端到端基于骨架的动作检测?
- RQ2如何将3D骨架序列有效编码为类似图像的表示,以保留其时间与空间运动模式?
- RQ3SSD框架在多大程度上可被适配于骨架映射图像中的动作检测,尤其是在动作片段具有高宽高比的情况下?
- RQ4平移和尺度不变的图像映射策略是否能提升基于骨架动作检测中的泛化能力与鲁棒性?
- RQ5统一的端到端框架是否能在大规模骨架检测基准上超越现有的两阶段或RNN-based方法?
主要发现
- 所提出的Skeleton Boxes方法在PKU-MMD数据集的跨视角评估中达到0.945的平均平均精度(mAP),在跨被试评估中达到0.613,显著优于先前最先进方法。
- 在跨视角划分中,与前一最佳方法(JCRRNN: 0.699)相比,mAP提升超过25个百分点(0.945 vs. 0.699),展现出显著的优越性。
- 在跨被试评估中,mAP达到0.613,较次佳方法(JCRRNN: 0.452)高出16.1个百分点,优势显著。
- 平移和尺度不变的图像映射策略有效消除了全局3D坐标偏移与尺度变化的影响,提升了模型鲁棒性。
- 通过自定义默认框(包含极高宽高比)适配SSD于骨架映射图像,实现了对长时行动作片段的精确检测。
- 结合困难负样本挖掘与数据增强的端到端训练策略,即使在训练数据有限的情况下,也能实现稳定收敛与强大泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。