[论文解读] Improved Deep Learning of Object Category using Pose Information
该论文提出2W-CNN,一种新型卷积神经网络,在训练过程中联合使用物体类别(是什么)和姿态(在哪里)标签进行端到端训练,以提升特征学习效果。通过在反向传播过程中使用姿态作为监督信号(而无需在测试时使用姿态信息),该模型在iLab-20M数据集的一个子集上比AlexNet高出6%的准确率,并且在标注数据有限的情况下,对ImageNet的泛化能力也更强。
Despite significant recent progress, the best available computer vision algorithms still lag far behind human capabilities, even for recognizing individual discrete objects under various poses, illuminations, and backgrounds. Here we present a new approach to using object pose information to improve deep network learning. While existing large-scale datasets, e.g. ImageNet, do not have pose information, we leverage the newly published turntable dataset, iLab-20M, which has ~22M images of 704 object instances shot under different lightings, camera viewpoints and turntable rotations, to do more controlled object recognition experiments. We introduce a new convolutional neural network architecture, what/where CNN (2W-CNN), built on a linear-chain feedforward CNN (e.g., AlexNet), augmented by hierarchical layers regularized by object poses. Pose information is only used as feedback signal during training, in addition to category information; during test, the feedforward network only predicts category. To validate the approach, we train both 2W-CNN and AlexNet using a fraction of the dataset, and 2W-CNN achieves 6% performance improvement in category prediction. We show mathematically that 2W-CNN has inherent advantages over AlexNet under the stochastic gradient descent (SGD) optimization procedure. Further more, we fine-tune object recognition on ImageNet by using the pretrained 2W-CNN and AlexNet features on iLab-20M, results show that significant improvements have been achieved, compared with training AlexNet from scratch. Moreover, fine-tuning 2W-CNN features performs even better than fine-tuning the pretrained AlexNet features. These results show pretrained features on iLab- 20M generalizes well to natural image datasets, and 2WCNN learns even better features for object recognition than AlexNet.
研究动机与目标
- 通过在训练过程中引入显式的姿态监督,解决标准CNN在学习解耦、姿态鲁棒特征方面的局限性。
- 探究在深度学习物体识别中,使用物体姿态作为监督信号是否能提升泛化能力和特征质量。
- 评估在受控的、带有姿态标注的数据集(iLab-20M)上预训练的特征,是否能有效迁移到自然图像数据集(如ImageNet)上。
- 证明联合学习类别与姿态可获得优于仅学习类别的特征表示。
- 证明所提出方法在真实世界图像上具有泛化能力,即使测试集与训练数据的环境不一致。
提出的方法
- 提出一种新型CNN架构2W-CNN,基于AlexNet构建,并在网络中增加专门用于姿态预测的输出头,实现类别与姿态的联合训练。
- 采用两种变体:2W-CNN-I(仅将姿态反馈传递至最后的全连接层)和2W-CNN-MI(将姿态反馈传递至所有卷积层)。
- 在训练过程中,同时反向传播两类误差信号:来自类别(是什么)头的误差和来自姿态(在哪里)头的误差,以联合正则化特征学习。
- 训练完成后,移除姿态专用的输出头,仅保留基础CNN结构(与AlexNet架构完全相同)用于推理,确保推理阶段无额外开销。
- 利用iLab-20M数据集,该数据集包含约2200万张图像,涵盖704种物体实例,在受控光照、视角和旋转条件下采集,提供丰富的姿态标注。
- 使用每类仅5至40张标注图像的少量样本,对在ImageNet上微调预训练的2W-CNN和AlexNet特征,以评估其泛化能力。
实验结果
研究问题
- RQ1在训练过程中引入显式姿态监督,是否能提升物体类别识别所学特征的质量?
- RQ2与仅学习类别的训练方式相比,同时在类别和姿态上进行联合训练,是否能提升在自然图像数据集(如ImageNet)上的泛化能力?
- RQ3姿态反馈的网络结构设计(例如,仅反馈至最后一层 vs. 反馈至所有卷积层)如何影响性能与特征学习?
- RQ4在受控的、带有姿态标注的数据集(iLab-20M)上预训练的特征,是否能有效迁移到真实世界、非受限的图像数据集(如ImageNet)上?
- RQ5姿态监督在多大程度上能减少下游任务微调所需的标注样本数量?
主要发现
- 当在iLab-20M数据集的子集上训练时,2W-CNN在物体类别预测任务上比AlexNet高出6%的性能。
- 从在iLab-20M上预训练的特征微调AlexNet,显著优于从随机初始化开始训练,当每类仅提供5张图像时,相对准确率提升达530%。
- 从在iLab-20M上预训练的2W-CNN-MI特征微调,优于从AlexNet特征微调,在每类仅5张图像时,达到9.27%的top-5准确率,而AlexNet仅为7.74%。
- 2W-CNN-MI模型具有良好的泛化能力:在ImageNet上应用时,能为相似物体视图预测一致的相机视角,如在包含88个离散姿态类别的定性结果中所示。
- 数学分析表明,由于类别与姿态信号的联合优化,2W-CNN在随机梯度下降下的优化过程具有内在优势。
- 即使在标注数据有限的情况下,使用40张图像每类微调2W-CNN-MI特征,在ImageNet上相比从零开始训练仍实现22%的相对性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。