[论文解读] Multi-level Metric Learning for Few-shot Image Recognition
该论文提出了一种多层级度量学习(MML)框架,通过联合计算像素级、部件级和全局级特征的相似性,以提升少样本图像识别性能。通过集成用于任务特定部件特征的部件级嵌入自适应图(PEAG)模块,并结合多层级度量,MML在miniImageNet(5-way 5-shot时达到81.41%)和FC100(5-way 5-shot时达到59.56%)上实现了最先进性能,相较于先前的单层级度量方法最高提升达8.0%。
Few-shot learning is devoted to training a model on few samples. Most of these approaches learn a model based on a pixel-level or global-level feature representation. However, using global features may lose local information, and using pixel-level features may lose the contextual semantics of the image. Moreover, such works can only measure the relations between them on a single level, which is not comprehensive and effective. And if query images can simultaneously be well classified via three distinct level similarity metrics, the query images within a class can be more tightly distributed in a smaller feature space, generating more discriminative feature maps. Motivated by this, we propose a novel Part-level Embedding Adaptation with Graph (PEAG) method to generate task-specific features. Moreover, a Multi-level Metric Learning (MML) method is proposed, which not only calculates the pixel-level similarity but also considers the similarity of part-level features and global-level features. Extensive experiments on popular few-shot image recognition datasets prove the effectiveness of our method compared with the state-of-the-art methods. Our code is available at \url{https://github.com/chenhaoxing/M2L}.
研究动机与目标
- 解决少样本学习中单层级特征表示的局限性,即可能丢失局部细节(像素级)或上下文语义(全局级)。
- 通过捕捉像素、部件和全局层级之间的语义相似性,提升判别性特征学习。
- 开发一种方法,使查询图像能在类别特定的特征空间中实现紧密聚类,利用互补的多层级度量。
- 通过融合多层级相似性度量,克服单度量方法在泛化上的失败,实现鲁棒分类。
提出的方法
- 提出部件级嵌入自适应图(PEAG)模块,用于提取基于补丁的部件级特征,并利用图卷积网络(GCN)建模部件间交互,生成任务特定表示。
- 设计一个多层级度量学习(MML)模块,同时在三个层级上计算相似性得分:像素级(通过局部描述符)、部件级(通过PEAG特征)和全局级(通过图像级嵌入)。
- 使用可学习权重(α, β, γ)融合三种相似性得分,形成统一、紧凑且具有判别性的特征空间用于分类。
- 采用最近邻匹配模块,基于多层级相似性的加权融合对查询图像进行分类。
- 使用元学习进行端到端训练,每轮采样200个任务,采用动量SGD优化器,每10个周期学习率衰减。
- 在元训练全模型前,先使用MLP对ResNet-12特征提取器进行预训练。
实验结果
研究问题
- RQ1结合像素级、部件级和全局级特征表示是否能提升少样本图像识别中特征嵌入的判别性和鲁棒性?
- RQ2与单层级度量学习相比,多层级度量学习在低数据场景下是否具有更好的泛化能力?
- RQ3当通过图建模增强后,部件级特征在相似性度量和分类准确率方面有何贡献?
- RQ4各层级(像素、部件、全局)对最终性能的相对贡献如何?三者融合是否为最优方案?
- RQ5可学习的多层级度量融合机制是否优于固定或单层级相似性函数,在少样本学习中表现更优?
主要发现
- 在5-way 5-shot的mini-ImageNet基准上,MML达到81.41%的准确率,分别比原型网络(73.41%)和DSN-MR(73.41%)高出8.0和8.0个百分点。
- 在FC100上,MML在5-way 5-shot设置下达到59.56%的准确率,超越先前最先进方法3.5个百分点。
- 消融研究证实,三个层级(像素、部件、全局)均不可或缺:移除任一层次均导致显著性能下降,单层级方法性能最低下降达5.4%。
- 仅使用PEAG模块在mini-ImageNet(5-way 1-shot)上达到74.27%的准确率,分别优于FEAT(73.47%)和GLoFA(72.49%)0.8%和1.8%。
- 最优超参数(α, β, γ)至关重要:不合适的取值会降低性能,表明多层级度量的均衡融合是性能关键。
- 在5-way 1-shot和5-way 5-shot设置下,模型在mini-ImageNet上的准确率分别为75.28%和85.95%,表明其在不同样本设置下均具备强大泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。