[论文解读] Few-shot Classification via Adaptive Attention
本文提出了一种新颖的少样本分类方法,通过元重加权策略实现自适应注意力机制,通过动态强调支持样本中的相关特征来优化查询表示。通过生成定位判别区域的空间注意力图,该模型在miniImageNet和细粒度数据集上实现了最先进性能,显著优于先前方法,同时保持轻量化和可解释性。
Training a neural network model that can quickly adapt to a new task is highly desirable yet challenging for few-shot learning problems. Recent few-shot learning methods mostly concentrate on developing various meta-learning strategies from two aspects, namely optimizing an initial model or learning a distance metric. In this work, we propose a novel few-shot learning method via optimizing and fast adapting the query sample representation based on very few reference samples. To be specific, we devise a simple and efficient meta-reweighting strategy to adapt the sample representations and generate soft attention to refine the representation such that the relevant features from the query and support samples can be extracted for a better few-shot classification. Such an adaptive attention model is also able to explain what the classification model is looking for as the evidence for classification to some extent. As demonstrated experimentally, the proposed model achieves state-of-the-art classification results on various benchmark few-shot classification and fine-grained recognition datasets.
研究动机与目标
- 为解决少样本分类中的挑战,即模型必须仅用极少的支持样本泛化到新类别。
- 克服现有元学习和基于度量方法的局限性,这些方法或存在高优化复杂度,或缺乏对支持-查询关系的适应能力。
- 开发一种轻量化、高效的框架,通过动态关注少量支持样本中的相关特征来增强查询表示。
- 通过生成突出查询图像中与支持类别相对应的判别区域的注意力图,提升模型可解释性。
提出的方法
- 一种元重加权策略通过小型神经网络从支持特征生成通道注意力系数,并通过逐元素乘法应用到查询特征以实现优化。
- 将优化后的查询和支持特征拼接后输入注意力模块,生成突出查询图像中相关区域的空间注意力图。
- 利用注意力图过滤查询表示中的无关特征,聚焦于与支持样本语义对齐的部分。
- 最终优化后的表示送入分类器以预测查询标签,注意力机制同时带来性能提升与可解释性。
- 在推理阶段应用测试数据增强,以稳定权重生成过程并提升鲁棒性。
- 整个框架端到端可训练,无需迭代优化,因此相比MAML类方法计算效率更高。
实验结果
研究问题
- RQ1元重加权策略是否能有效利用少量支持样本自适应地优化查询表示,从而提升少样本分类性能?
- RQ2如何使注意力机制能够自适应支持样本而非固定或全局设置,以增强定位与分类准确率?
- RQ3所提方法在标准少样本基准测试上是否优于现有基于度量和元学习的方法?
- RQ4模型生成的注意力图在多大程度上能为分类决策提供可解释的证据?
- RQ5与MAML等基于优化的元学习方法相比,该方法是否更具效率且更易训练?
主要发现
- 所提方法在5类1样本的miniImageNet基准上达到64.51% ± 0.95的最先进准确率,显著优于先前SOTA方法。
- 在细粒度数据集上,模型在5类1样本设置下达到70.73% ± 0.97的准确率,在5类5样本设置下达到87.72% ± 0.53,展现出在多样化少样本任务中的强大泛化能力。
- 消融实验表明,若将元重加权替换为特征拼接,1样本设置下的性能下降至51.31%,凸显保留空间结构的重要性。
- 测试数据增强将1样本设置下的准确率从56.12%提升至56.33%,表明权重生成过程更加稳定。
- 模型生成的注意力图能清晰定位目标物体(如一只狗),而基于拼接的基线方法则产生混乱且非判别性的图。
- 分类器组件至关重要——若移除分类器而仅依赖注意力图进行分类,准确率下降,证实专用分类头的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。