[论文解读] Tree Structure-Aware Few-Shot Image Classification via Hierarchical Aggregation
该论文提出了一种即插即用的分层树结构感知(HTS)方法,用于少样本图像分类。该方法通过树结构建模原始图像与增强图像之间的关系,并利用门控聚合器自适应选择有用特征。HTS通过更有效地利用预训练任务进行结构化特征聚合,显著提升了多种少样本学习方法,在四个基准数据集上取得了新的最先进性能。
In this paper, we mainly focus on the problem of how to learn additional feature representations for few-shot image classification through pretext tasks (e.g., rotation or color permutation and so on). This additional knowledge generated by pretext tasks can further improve the performance of few-shot learning (FSL) as it differs from human-annotated supervision (i.e., class labels of FSL tasks). To solve this problem, we present a plug-in Hierarchical Tree Structure-aware (HTS) method, which not only learns the relationship of FSL and pretext tasks, but more importantly, can adaptively select and aggregate feature representations generated by pretext tasks to maximize the performance of FSL tasks. A hierarchical tree constructing component and a gated selection aggregating component is introduced to construct the tree structure and find richer transferable knowledge that can rapidly adapt to novel classes with a few labeled images. Extensive experiments show that our HTS can significantly enhance multiple few-shot methods to achieve new state-of-the-art performance on four benchmark datasets. The code is available at: https://github.com/remiMZ/HTS-ECCV22.
研究动机与目标
- 为了解决现有少样本学习方法在预训练任务中 indiscriminately 使用所有增强图像所带来的局限性,这些图像可能因语义信息模糊而降低性能。
- 通过从预训练任务中学习可迁移的知识(超越人工标注的标签),以提升少样本学习的泛化能力。
- 开发一种灵活的即插即用框架,能够根据与少样本分类任务的相关性,自适应地选择并聚合来自多个预训练任务的特征表示。
- 利用树结构建模原始图像及其增强图像之间的分层关系,支持预训练任务或增强数据的动态变化。
提出的方法
- 引入分层树构建组件,用于建模来自不同预训练任务的原始图像与增强图像之间的关系,其中节点表示图像,边编码特征相似性。
- 树结构通过多层表示来自不同预训练任务的特征,使模型能够分层学习任务特定和共享的表示。
- 基于TreeLSTM设计门控选择聚合组件,动态加权并聚合树中不同节点的特征,优先选择信息量丰富且可迁移的表示。
- 该方法在数据增强(DA)和自监督学习(SSL)设置下均适用,可作为即插即用模块集成到现有少样本学习框架中。
- 模型采用多任务目标进行训练,联合优化少样本分类损失和预训练任务损失,树结构引导选择性特征融合。
- 该框架兼容标准主干网络(如Conv4和ResNet12),并以端到端方式应用全局平均池化和最终全连接层,生成64维嵌入表示。
实验结果
研究问题
- RQ1结构化表示增强图像是否能超越标准数据增强或自监督学习,进一步提升少样本分类性能?
- RQ2模型如何自适应地从多个预训练任务中选择最有用的特征表示,以避免因模糊增强带来的负迁移?
- RQ3对增强图像之间分层关系的建模,在低样本设置下在多大程度上提升了特征的可迁移性和泛化能力?
- RQ4所提出的方法是否在多样化的数据集和少样本学习设置(包括跨域场景)中具有良好的泛化能力?
主要发现
- HTS在四个基准数据集(mini-ImageNet、tiered-ImageNet、CUB-200-2011和CIFAR-FS)上均取得了新的最先进性能,涵盖1-shot和5-shot设置。
- 在mini-ImageNet上,当使用旋转和色彩置换预训练任务时,HTS在5-way 1-shot设置下将ProtoNet的准确率提升了2.1%,在5-way 5-shot设置下提升了1.8%。
- 该方法展现出强大的跨域泛化能力,在跨域评估中,无论是在单域还是非对角域偏移设置下,均优于ProtoNet。
- Grad-CAM可视化结果表明,HTS促使模型关注更具判别性的局部物体特征,相比基线模型,有效减少了由预训练任务引起的语义偏差。
- 消融实验验证了分层树结构和门控聚合机制均至关重要:树结构提升了特征组织能力,门控机制增强了选择准确性。
- 该方法在不同预训练任务(如旋转和色彩置换)下均表现出鲁棒性,在所有四个数据集上均实现了稳定且一致的性能提升,无论任务类型如何。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。