[论文解读] Deep filter banks for texture recognition, description, and segmentation
本文提出了一套包含47种纹理属性的人类可解释词汇表,并构建了一个新的数据集(DTD),用于描述真实世界图像中的纹理。结果表明,通过池化深度卷积神经网络(CNN)层的特征——作为学习到的滤波器组——在纹理识别、属性描述和分割任务中均取得了当前最优性能,即使在杂乱和真实场景条件下也表现优异,在FMD和KTH-T2b等基准数据集上相比之前的方法有显著提升。
Visual textures have played a key role in image understanding because they convey important semantics of images, and because texture representations that pool local image descriptors in an orderless manner have had a tremendous impact in diverse applications. In this paper we make several contributions to texture understanding. First, instead of focusing on texture instance and material category recognition, we propose a human-interpretable vocabulary of texture attributes to describe common texture patterns, complemented by a new describable texture dataset for benchmarking. Second, we look at the problem of recognizing materials and texture attributes in realistic imaging conditions, including when textures appear in clutter, developing corresponding benchmarks on top of the recently proposed OpenSurfaces dataset. Third, we revisit classic texture representations, including bag-of-visual-words and the Fisher vectors, in the context of deep learning and show that these have excellent efficiency and generalization properties if the convolutional layers of a deep model are used as filter banks. We obtain in this manner state-of-the-art performance in numerous datasets well beyond textures, an efficient method to apply deep features to image regions, as well as benefit in transferring features from one domain to another.
研究动机与目标
- 开发一套用于描述真实世界图像中常见纹理图案的人类可解释纹理属性词汇表。
- 基于OpenSurfaces数据集,创建新的基准数据集,用于在真实、杂乱的成像条件下进行材料和纹理属性识别。
- 通过将CNN卷积层用作学习到的滤波器组,重新评估经典纹理表示方法(如词袋视觉词、Fisher向量)在深度学习背景下的表现。
- 通过结合深度特征与无序池化方法,实现在区域级别上的高效、可迁移特征提取。
提出的方法
- 提出一个包含5,640张图像的数据集,每张图像均标注了47种纹理属性,数据来源于真实世界,以支持语义纹理描述。
- 使用预训练深度CNN(如VGG)的卷积层特征作为学习到的滤波器组,提取局部图像描述符。
- 在CNN特征之上应用传统的池化编码器——特别是Fisher向量(FV)编码——以生成紧凑且无序的表示。
- 在池化后的特征上训练线性或RBF分类器,以预测纹理属性或材料类别。
- 通过使用预训练ImageNet模型的特征(无需微调)实现迁移学习,支持跨域特征迁移。
- 在目标数据集(如Houzz)上对分类器得分进行校准和重标度,以生成归一化的概率分数,便于可视化和检索。
实验结果
研究问题
- RQ1人类可解释的纹理属性词汇表是否能有效描述真实世界图像中多样的纹理模式?
- RQ2当将深度CNN特征用作滤波器组并使用Fisher向量进行池化时,其在纹理、材料和物体识别任务中的泛化能力如何?
- RQ3在类似OpenSurfaces数据集中的杂乱和真实成像条件下,是否能可靠地进行纹理属性预测?
- RQ4使用深度网络早期卷积层的特征是否在纹理理解任务中优于传统手工设计的描述符或深层特征?
- RQ5在不进行微调的情况下,从深度网络中提取的特征在多大程度上可以实现跨域迁移?
主要发现
- 包含47种纹理属性的DTD数据集能够有效实现纹理的语义描述,定性结果显示属性与图像内容之间具有良好的语义对齐(例如,面包被预测为‘凹凸不平’、‘有凹坑’、‘多孔’)。
- 在KTH-T2b数据集上,使用Fisher向量编码早期CNN卷积层特征,达到77.1%的准确率,优于之前的SOTA方法(76.0%),展现出强大的泛化能力。
- 在Flickr Material Dataset(FMD)上,该方法达到72.17%的准确率,显著优于之前的SOTA方法(57.7%),性能提升达15个百分点。
- DTD特征极为紧凑(比其他描述符小两个数量级),支持高效的RBF分类,仅比线性分类器性能下降1-3%。
- 在Houzz.com的10,000张墙纸和床单图像数据集中,DTD属性能够生成有意义且可解释的描述,通常前三项属性即可提供准确的视觉表征。
- 该方法的泛化能力超越纹理任务:在粗粒度和细粒度物体分类以及场景分类任务中也达到了SOTA性能,证明了深度滤波器组作为通用图像描述符的多功能性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。