[论文解读] Learning to Decompose Visual Features with Latent Textual Prompts
本文提出了一种名为分解特征提示(DeFo)的新颖视觉-语言推理框架,通过使用可学习的、解耦的文本提示替代硬编码的文本类别名称,以提升零样本和线性探测的准确率。通过将视觉特征与语义类别标签解耦,并使用可学习的线性分类器,DeFo 在使用 ResNet-50 主干网络的情况下,在 ImageNet 上实现了 73.2% 的 top-1 准确率——比零样本 CLIP 高出 15.0 个百分点,比当前最先进提示调优方法高出 7.6 个百分点——且无需微调任何预训练权重。
Recent advances in pre-training vision-language models like CLIP have shown great potential in learning transferable visual representations. Nonetheless, for downstream inference, CLIP-like models suffer from either 1) degraded accuracy and robustness in the case of inaccurate text descriptions during retrieval-based inference (the challenge for zero-shot protocol); or 2) breaking the well-established vision-language alignment (the challenge for linear probing). To address them, we propose Decomposed Feature Prompting (DeFo). DeFo leverages a flexible number of learnable embeddings as textual input while maintaining the vision-language dual-model architecture, which enables the model to learn decomposed visual features with the help of feature-level textual prompts. We further use an additional linear layer to perform classification, allowing a scalable size of language inputs. Our empirical study shows DeFo's significance in improving the vision-language models. For example, DeFo obtains 73.2% test accuracy on ImageNet with a ResNet-50 backbone without tuning any pretrained weights of both the vision and language encoder, outperforming zero-shot CLIP by a large margin of 15.0%, and outperforming state-of-the-art vision-language prompt tuning method by 7.6%.
研究动机与目标
- 为解决 CLIP 类模型中的表达敏感性问题,即由于对特定类别名称措辞的依赖,导致推理准确率下降。
- 克服概念敏感性问题,即在零样本设置下,罕见或分布外概念识别效果差。
- 通过保留语言编码器,维持线性探测过程中的视觉-语言对齐,从而提升少样本和迁移学习性能。
- 实现在不微调预训练视觉或语言编码器的前提下,可扩展的、高准确率的零样本和线性探测推理。
- 开发一种双模型提示框架,将视觉特征表示与硬性语义目标解耦。
提出的方法
- DeFo 引入一组可学习的、与任务无关的文本嵌入(提示),作为输入送入语言编码器,与类别名称解耦。
- 该模型采用双编码器架构,保留了预训练过程中学习到的视觉-语言对齐。
- 视觉编码器提取的视觉特征经投影后,通过语言编码器输出顶部的可学习线性层进行分类。
- 可学习提示的数量(n)及其长度(m)为超参数,实验表明对中等范围的变化具有鲁棒性。
- 该方法通过使用相同的冻结视觉和语言编码器与可训练分类器,实现了零样本和线性探测推理。
- DeFo 的文本提示通过端到端训练,将视觉特征分解为语义上有意义的组成部分,从而提升特征解耦程度。
实验结果
研究问题
- RQ1可学习的、解耦的文本提示机制是否能在不微调预训练权重的前提下,提升视觉-语言模型的零样本准确率?
- RQ2将视觉特征与硬性类别名称目标解耦,是否能缓解 CLIP 风格模型中的表达敏感性问题?
- RQ3在线性探测过程中保持语言编码器,是否能维持视觉-语言对齐,从而提升少样本和迁移学习性能?
- RQ4可学习提示的数量和长度如何影响 DeFo 的性能与鲁棒性?
- RQ5所学习的文本提示在多大程度上捕捉了超越原始类别标签的有意义语义概念?
主要发现
- DeFo 在使用 ResNet-50 主干网络的情况下,无需微调任何预训练权重,在 ImageNet 上实现了 73.2% 的 top-1 准确率,比零样本 CLIP 高出 15.0 个百分点。
- 在 11 个多样化的图像分类基准上,DeFo 的平均准确率达到 79.9%,比零样本 CLIP 高出 21.0 个百分点,比 CoOp 高出 6.2 个百分点。
- 消融研究显示,DeFo 对超参数具有鲁棒性:将提示数量从 2048 减少到 256,准确率仅下降 0.7%。
- DeFo 的性能提升并非源于额外的线性分类器,因为在 CLIP 或 CoOp 中添加相同层最多仅带来 4% 的准确率提升。
- 定性分析表明,DeFo 学习到了语义上有意义的特征,如颜色(例如 'red')、形状(例如 'ring')和背景(例如 'snow'),甚至捕捉到了父类别如 'dogs' 和 'sunflowers'。
- 通过保留语言编码器,DeFo 维持了强大的少样本和迁移学习性能,有助于约束视觉特征投影并维持对齐。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。