[论文解读] Deep Descriptor Transforming for Image Co-Localization
本文提出了一种新型无监督方法——深度描述符转换(Deep Descriptor Transforming, DDT),该方法利用预训练的卷积神经网络(CNN)特征,通过转换描述符以建模图像间的相关性,实现跨图像集的常见物体检测。DDT在图像共定位基准测试中达到最先进性能,显著优于先前方法,并展现出对噪声图像的强鲁棒性以及对未见类别的良好泛化能力。
Reusable model design becomes desirable with the rapid expansion of machine learning applications. In this paper, we focus on the reusability of pre-trained deep convolutional models. Specifically, different from treating pre-trained models as feature extractors, we reveal more treasures beneath convolutional layers, i.e., the convolutional activations could act as a detector for the common object in the image co-localization problem. We propose a simple but effective method, named Deep Descriptor Transforming (DDT), for evaluating the correlations of descriptors and then obtaining the category-consistent regions, which can accurately locate the common object in a set of images. Empirical studies validate the effectiveness of the proposed DDT method. On benchmark image co-localization datasets, DDT consistently outperforms existing state-of-the-art methods by a large margin. Moreover, DDT also demonstrates good generalization ability for unseen categories and robustness for dealing with noisy data.
研究动机与目标
- 探索并利用预训练深度卷积神经网络在特征提取之外的可重用性,特别是用于无监督物体定位。
- 通过利用卷积激活作为检测器,解决图像共定位问题——即在无任何标注的情况下,定位一组图像中的共同物体。
- 开发一种对噪声图像具有鲁棒性且能良好泛化到 ImageNet 中未出现过的未见类别的方法。
- 证明可通过有效建模图像间描述符的相关性,在无监督条件下识别类别一致的区域。
提出的方法
- 从每组图像中预训练的 CNN(如 VGG-16)的最后一个卷积层提取深度卷积描述符。
- 对图像组中连接后的描述符应用鲁棒主成分分析(RPCA),将其分解为低秩分量(表示共同物体模式)和稀疏分量(表示噪声或异常值)。
- 将低秩矩阵的第一个主成分(P¹)用作指示图以定位共同物体,其中值越高表示越可能是物体区域。
- 将 P¹ 中正值的数量视为检测分数:正值越少,表示图像越可能为噪声图像(不包含共同物体)。
- 通过主成分分析(PCA)将描述符变换到新空间,以评估和增强图像间描述符的相关性。
- 利用低秩分量的结构识别并抑制不包含共同物体的图像。
实验结果
研究问题
- RQ1预训练模型的卷积激活能否在无监督条件下有效作为图像共定位中共同物体的检测器?
- RQ2DDT 在 ImageNet 预训练期间未见过的物体类别上泛化能力如何?
- RQ3DDT 在多大程度上能够检测并拒绝不包含共同物体的噪声图像?
- RQ4图像间描述符的相关性结构能否被有效建模,以实现无监督的共同物体定位?
- RQ5与标准 PCA 或其他基线方法相比,使用鲁棒 PCA 是否能提升定位准确率和抗噪声能力?
主要发现
- 在 ImageNet 子集数据集上,DDT 的平均 CorLoc 达到 69.1%,显著优于之前最先进方法(Li et al., 2016)的 48.3%。
- 在物体发现数据集上,DDT 在无噪声条件下达到 68.2% 的 CorLoc,比 Image-Box 方法(Tang et al., 2014)高出约 12%。
- DDT 展现出对噪声图像的强鲁棒性,其 ROC AUC 分数显著高于 Image-Box 方法,该结论已在物体发现数据集上得到验证。
- 定性结果表明,即使图像中存在其他物体(如人物),DDT 仍能成功定位共同物体(如耙子、轮椅)。
- 第二个主成分(P²)揭示了部件级结构,例如在狗图像中将头部与躯干分离,表明未来可拓展用于基于部件的共定位。
- DDT 对未见类别泛化良好,例如在 ImageNet 原始类别中未包含的 'rake' 和 'wheelchair' 等类别上表现优异。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。