Skip to main content
QUICK REVIEW

[论文解读] Few-Shot Learning by Integrating Spatial and Frequency Representation

Xiangyu Chen, Guanghui Wang|arXiv (Cornell University)|May 11, 2021
Domain Adaptation and Few-Shot Learning参考文献 43被引用 4
一句话总结

本文提出通过离散余弦变换(DCT)预处理,将空间域与频域表征进行融合,以提升少样本图像分类性能。通过使用CNN主干网络融合来自两个域的特征,该方法在5-way 1-shot miniImageNet上实现了高达62.30%的准确率,显著提升——这表明频域信息可有效补充空间特征,增强模型的判别能力。

ABSTRACT

Human beings can recognize new objects with only a few labeled examples, however, few-shot learning remains a challenging problem for machine learning systems. Most previous algorithms in few-shot learning only utilize spatial information of the images. In this paper, we propose to integrate the frequency information into the learning model to boost the discrimination ability of the system. We employ Discrete Cosine Transformation (DCT) to generate the frequency representation, then, integrate the features from both the spatial domain and frequency domain for classification. The proposed strategy and its effectiveness are validated with different backbones, datasets, and algorithms. Extensive experiments demonstrate that the frequency information is complementary to the spatial representations in few-shot classification. The classification accuracy is boosted significantly by integrating features from both the spatial and frequency domains in different few-shot learning tasks.

研究动机与目标

  • 解决在医疗影像等数据稀缺领域中,标注样本有限的少样本图像分类挑战。
  • 克服现有少样本学习模型仅依赖空间图像特征的局限性。
  • 探究通过DCT提取的频域表征是否能增强特征判别能力与模型泛化性能。
  • 在多种主干网络、数据集及少样本学习设置下,验证空间与频域特征融合的有效性。

提出的方法

  • 在输入图像上应用离散余弦变换(DCT),生成频域表征后输入CNN主干网络。
  • 采用两条并行的CNN分支:一条处理原始空间域图像(CNN(s)),另一条处理DCT变换后的频域特征(CNN(f))。
  • 将两条分支的特征嵌入(空间与频域)进行拼接,形成统一的表征用于分类。
  • 在DCT域中采用静态通道选择,聚焦低频分量,以降低计算成本,同时保留判别性信息。
  • 将所提出的基于DCT的频域模块作为即插即用组件,集成至现有少样本学习框架(如baseline++)中。
  • 利用t-SNE可视化对比仅使用空间特征与融合空间-频域特征的模型在特征聚类质量上的差异。

实验结果

研究问题

  • RQ1通过DCT提取的频域表征,与空间特征结合后,能否提升少样本分类性能?
  • RQ2DCT滤波器的大小对少样本学习任务中的分类准确率有何影响?
  • RQ3与仅使用空间特征相比,空间与频域特征的融合是否能带来更优的特征聚类效果与泛化能力?
  • RQ4该方法在不同主干网络架构(如ResNet10、ResNet18、ResNet34)及少样本学习基准上的鲁棒性如何?
  • RQ5数据增强与频域特征融合在提升模型准确率方面,各自贡献如何?

主要发现

  • 所提方法在ResNet10主干下,于5-way 1-shot miniImageNet基准上达到62.30%的top-1准确率,相较baseline++(s)模型提升4.78个百分点。
  • 在5-way 5-shot任务中,使用ResNet10的融合模型在miniImageNet上达到79.93%的准确率,相较仅使用空间特征的基线模型提升4.37%。
  • 仅使用频域分支(CNN(f))在所有主干网络与任务中均持续优于仅使用空间特征的基线模型,表明频域特征本身即可提供显著的判别能力。
  • 双域特征融合带来最高性能增益,在不同主干网络上相较仅使用空间特征的基线模型,准确率提升范围为4.37%至5.75%。
  • 在采用静态通道选择时,DCT滤波器大小对性能影响极小,表明小尺寸滤波器(如8×8)已足以实现有效的特征提取。
  • t-SNE可视化结果表明,融合模型生成的特征聚类更紧凑且分离度更高,证实其具备更强的特征判别能力与泛化性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。