[论文解读] HyperTransformer: Model Generation for Supervised and Semi-Supervised Few-Shot Learning
HyperTransformer 提出了一种基于 Transformer 的模型,能够直接从少量样本的支持集生成小型卷积神经网络(CNN)的所有权重,将任务特定的复杂性与目标模型解耦。该方法在少样本基准测试中取得了最先进性能,尤其适用于小型 CNN,并可通过生成所有层或仅最后的 logits 层,自然扩展至半监督学习。
In this work we propose a HyperTransformer, a Transformer-based model for supervised and semi-supervised few-shot learning that generates weights of a convolutional neural network (CNN) directly from support samples. Since the dependence of a small generated CNN model on a specific task is encoded by a high-capacity Transformer model, we effectively decouple the complexity of the large task space from the complexity of individual tasks. Our method is particularly effective for small target CNN architectures where learning a fixed universal task-independent embedding is not optimal and better performance is attained when the information about the task can modulate all model parameters. For larger models we discover that generating the last layer alone allows us to produce competitive or better results than those obtained with state-of-the-art methods while being end-to-end differentiable.
研究动机与目标
- 解决基于度量和基于优化的少样本学习方法的局限性,这些方法依赖于固定且通用的嵌入表示或有限的参数更新。
- 通过使用高容量 Transformer 生成特定任务的 CNN 权重,将任务空间的复杂性与单个模型解耦。
- 实现端到端可微训练的少样本学习,无需嵌套梯度或复杂的优化方案。
- 通过将未标记样本纳入支持集,将该框架扩展至半监督少样本学习。
- 研究根据模型大小和任务复杂度,生成所有 CNN 层与仅生成最终 logits 层之间的权衡。
提出的方法
- 使用基于 Transformer 的权重生成器,将支持集图像和标签作为输入,在一次前向传播中生成所有 CNN 权重。
- 利用自注意力机制处理可变大小的支持集并处理类别不平衡问题,无需位置编码或掩码机制。
- 端到端训练 HyperTransformer,通过生成的 CNN 权重最小化查询集上的交叉熵损失。
- 通过添加特殊标记来编码支持集中的未标记样本,支持半监督学习。
- 支持灵活的架构设计:可仅生成最终的 logits 层(适用于大模型)或所有卷积层(适用于小模型)。
- 使用 UMAP 可视化不同类别间生成的 CNN 权重的语义聚类,表明权重生成过程中编码了语义依赖关系。
实验结果
研究问题
- RQ1基于 Transformer 的模型能否有效直接从少量样本支持集生成小型 CNN 的所有权重,从而提升少样本泛化能力?
- RQ2与仅生成最后一层相比,生成所有卷积层(而不仅是最终的 logits 层)是否能带来更好的性能,尤其是在小型模型上?
- RQ3在支持集中包含未标记样本如何影响少样本性能?Transformer 的深度在利用这些样本方面起到什么作用?
- RQ4与使用静态 CNN 主干网络相比,通过 HyperTransformer 生成所有模型参数的性能权衡如何?
- RQ5在何种模型大小阈值下,仅生成最后一层即足够?影响该阈值的因素有哪些?
主要发现
- 对于小型 CNN(如 4 通道和 6 通道模型),HyperTransformer 在生成所有卷积层和最终 logits 层的情况下,优于 MAML++ 和 RFS。
- 对于大模型(如 8 通道及以上),仅生成最终 logits 层即可达到峰值性能,与最先进方法相当,表明生成中间层的收益递减。
- 包含未标记样本能显著提升性能,尤其当 Transformer 拥有两个或更多层时,可实现类似最近邻的泛化能力。
- 两层 Transformer 可以编码最近邻算法,使模型能够将未标记样本与相似的已标记样本关联,而无需显式优化目标。
- 使用 UMAP 的可视化显示,生成的 CNN 权重按类别聚类,表明语义信息被编码在权重生成过程中。
- 在使用大卷积核和步长(如 9×9,步长 4)的模型中,与仅生成最终层相比,额外生成至少一层卷积层可将测试准确率提高约 1%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。