[论文解读] Context-Aware Meta-Learning
本文提出上下文感知元学习(CAML),一种新颖的元学习框架,可在推理阶段实现对新视觉类别的零样本泛化,且无需元训练或微调。通过将少样本分类重新表述为对支持集和查询图像的序列建模,并使用固定且最优的标签嵌入(ELMES),CAML 在 11 个基准中的 8 个上达到最先进性能,实现了类似大语言模型的上下文学习能力,适用于视觉任务。
Large Language Models like ChatGPT demonstrate a remarkable capacity to learn new concepts during inference without any fine-tuning. However, visual models trained to detect new objects during inference have been unable to replicate this ability, and instead either perform poorly or require meta-training and/or fine-tuning on similar objects. In this work, we propose a meta-learning algorithm that emulates Large Language Models by learning new visual concepts during inference without fine-tuning. Our approach leverages a frozen pre-trained feature extractor, and analogous to in-context learning, recasts visual meta-learning as sequence modeling over datapoints with known labels and a test datapoint with an unknown label. On 8 out of 11 meta-learning benchmarks, our approach -- without meta-training or fine-tuning -- exceeds or matches the state-of-the-art algorithm, P>M>F, which is meta-trained on these benchmarks. Our code is available at https://github.com/cfifty/CAML.
研究动机与目标
- 使视觉模型能够在推理过程中无需元训练或微调即可学习新概念,模仿大语言模型中的上下文学习能力。
- 解决现有元学习方法在分布外或细粒度类别上泛化能力不足的问题。
- 开发一种通用的元学习框架,能够在推理时对任何新视觉概念进行分类。
- 证明对图像-标签序列进行序列建模可实现动态、上下文感知的表示,从而提升少样本泛化性能。
提出的方法
- 使用冻结的 CLIP 特征提取器对支持集和查询图像进行表示,获得固定的图像嵌入。
- 通过等长最大等角集(ELMES)对类别标签进行编码,生成具有最小熵的固定且最优的标签嵌入。
- 将图像嵌入与标签嵌入拼接为联合图像-标签向量,并将其排列为序列输入 Transformer 编码器。
- 在多样化数据集上对 Transformer 编码器进行预训练,使用上下文学习目标:根据支持集和查询点的完整序列预测查询标签。
- 利用 Transformer 中的自注意力机制,实现对支持集和查询图像表示的动态、上下文依赖的更新。
- 通过仅依赖预训练特征和固定的 ELMES 标签编码,避免元训练和微调,从而实现通用泛化。
实验结果
研究问题
- RQ1视觉元学习能否在无需元训练或微调的情况下实现类似大语言模型的上下文学习?
- RQ2将元学习重新表述为序列建模,如何提升在多样化及分布外类别上的少样本泛化能力?
- RQ3在少样本设置中,最小化分类不确定性的最优固定标签编码策略是什么?
- RQ4序列模型中的动态、上下文感知表示相比静态、孤立的图像嵌入,如何提升性能?
- RQ5在通用元学习中,固定 ELMES 标签编码是否优于可学习嵌入?
主要发现
- CAML 在 11 个元学习基准中的 8 个上达到最先进性能,且无需任何元训练或微调,性能优于或匹配最先进方法 P>M>F。
- 在 Aircraft 基准上,CAML 的可学习嵌入变体在 5 类 1 样本划分上达到 66.3±0.2 的准确率,超越所有其他通用元学习基线方法。
- 固定 ELMES 标签编码收敛至最优配置,成对夹角为 1.82 弧度,范数为 1.32,与理论最优值极为接近。
- CAML 通过关注查询和支持集上下文,动态更新表示,即使 CLIP 嵌入模糊或具有误导性,也能实现正确分类。
- 消融实验表明,固定 ELMES 编码器在 11 个基准中的 10 个上与可学习嵌入性能几乎完全一致,证实其最优性与鲁棒性。
- 通过利用上下文感知注意力机制,模型成功对细粒度和低分辨率图像进行分类,展示了超越元训练分布的强大泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。