[论文解读] Actions and Attributes from Wholes and Parts
本文提出了一种基于深度部件的新型方法,用于人体动作与属性分类,采用一种新颖的深层姿态部件(poselets)模型,从卷积神经网络特征中检测身体部位(头部、躯干、腿部)。通过在整体图像和部件级特征上联合微调一个整体CNN,该方法在PASCAL VOC 2012动作识别和Berkeley Attributes of People数据集上取得了当前最优性能,即使在使用R-CNN检测结果替代真实标注边界框的情况下依然表现优异,表明尽管整体深度模型已取得显著进展,显式部件建模仍具有重要价值。
We investigate the importance of parts for the tasks of action and attribute classification. We develop a part-based approach by leveraging convolutional network features inspired by recent advances in computer vision. Our part detectors are a deep version of poselets and capture parts of the human body under a distinct set of poses. For the tasks of action and attribute classification, we train holistic convolutional neural networks and show that adding parts leads to top-performing results for both tasks. In addition, we demonstrate the effectiveness of our approach when we replace an oracle person detector, as is the default in the current evaluation protocol for both tasks, with a state-of-the-art person detection system.
研究动机与目标
- 澄清在近期整体CNN模型取得成功背景下,部件建模是否对动作与属性分类依然至关重要。
- 开发一种基于CNN高层特征而非传统HOG特征的深层、受姿态部件启发的部件检测器。
- 评估在测试时使用最先进的行人检测器而非真实标注边界框时,部件对性能的影响。
- 探究部件带来的性能增益究竟是源于部件本身,还是源于以往研究中整体基线模型的薄弱。
提出的方法
- 提出一种基于预训练CNN(如CaffeNet)的深层特征金字塔的滑动窗口检测器,替代传统HOG特征,构建深层版本的poselets。
- 通过将关键点聚类为不同姿态部件,检测头部、躯干和腿部三个关键身体部位,实现在多种姿态下的鲁棒检测。
- 使用R-CNN行人检测器生成的区域建议作为输入,替代评估协议中常用的真值边界框。
- 采用双分支分类头设计:一个用于整体人物分类,另一个用于每个检测到的部件,其特征输入至微调后的CNN。
- 对CNN实施任务特定的微调策略,比较在整体样本与部件上联合微调与仅对整体样本微调的性能差异。
- 在标准基准测试集PASCAL VOC 2012动作识别与Berkeley Attributes of People数据集中,以平均精度(AP)作为评估指标。
实验结果
研究问题
- RQ1当使用强大的整体CNN时,部件建模是否仍能为动作与属性分类带来显著性能提升?
- RQ2基于CNN高层特征的深层部件检测器是否能在检测坐姿或站姿腿部等具有挑战性的身体部位时,超越传统的HOG基姿态部件方法?
- RQ3在评估中用最先进的R-CNN检测结果替代真实标注边界框时,性能如何变化?
- RQ4部件带来的性能增益主要源于部件本身,还是源于以往研究中整体基线模型的不足?
主要发现
- 所提方法在PASCAL VOC 2012动作分类基准上达到当前最优性能,使用R-CNN检测结果时平均AP达到86.1%。
- 在Berkeley Attributes of People数据集中,联合微调的16层模型达到89.5% mAP,优于先前SOTA的PANDA系统(79.0% mAP),且使用R-CNN检测结果作为输入。
- 即使不使用部件信息,16层整体CNN在属性数据集上也达到88.4% mAP,与PANDA系统性能相当,表明先前SOTA性能的提升主要源于基线模型过弱。
- 随着网络深度增加,添加部件带来的边际增益逐渐减小,表明随着整体模型性能提升,显式部件建模的贡献可能降低。
- 将真实标注边界框替换为R-CNN检测结果仅导致性能小幅下降(如属性数据集上mAP下降约3.5%),验证了在评估中使用真实世界检测系统是合理的。
- 在整体样本与部件上联合微调CNN的性能优于仅对整体样本微调,尤其在浅层网络中更为明显。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。